Software y producto

Construyo sistemas de IA donde la IA nunca es la fuente de verdad

Cuatro proyectos: un SaaS de turnos corriendo en producción, investigación publicada de machine learning, un agente de incidentes de pagos construido en 24 horas y matching laboral con zero-knowledge. Cada uno traza un límite explícito sobre lo que el software tiene permitido decidir.

* pasá el cursor por cualquier número — todos citan su fuente.

01

TurnoBot

De un mensaje de WhatsApp a un turno confirmado.

Un SaaS de turnos con WhatsApp como canal principal, para negocios que trabajan con cita previa: está en producción y aprobado por Meta. La conversación es una máquina de estados determinista — sin LLM en el loop: la disponibilidad sale de un motor de scheduling puro, y la doble reserva se evita dentro de Postgres, con un advisory lock y una revalidación dentro de la misma transacción.

Replay de una reserva verificada: el mensaje “quiero un turno” inicia un flujo guiado — servicio, profesional (asignado automáticamente a Agustin), horarios reales para el viernes 4 de septiembre salteando el fin de semana, confirmación a las 17:30 — mientras un engine log muestra cada decisión determinista, incluidos el advisory lock de Postgres y la revalidación dentro de la transacción.

De un mensaje a un turno

● corrida verificada

qué decide — engine log

Replay de una reserva end-to-end verificada (2026-09-03); etiquetas simplificadas, comportamiento del motor real.Probalo en vivo — el mismo motor que en WhatsApp ↗

02con Ciro Vilmer

ReviewLens

¿Podés distinguir una reseña humana de una de GPT-4?

Detección multilingüe de reseñas de hotel generadas por IA en 10 idiomas: siete modelos, un empate estadístico en ~0.94 y un XLM-RoBERTa fine-tuneado que rompió el techo. El hallazgo honesto: los modelos entrenados no generalizan — la metodología sí.

Accuracy en el test held-out según la representación: contadores estilométricos 0.839; TF-IDF 0.947, XGBoost 0.945 y redes neuronales por idioma 0.940 forman un empate estadístico, un techo cercano a 0.94; XLM-RoBERTa fine-tuneado lo rompe con 0.959 y un intervalo de confianza del 95% de 0.953 a 0.964.

La escalera de representaciones

21 contadores interpretables

Solo la forma de la escritura: puntuación, dígitos, emoji, señales de longitud — ni una palabra. La forma sola ya supera el piso de solo-longitud y define el primer escalón.

0.839 acc · 95% CI [0.828–0.851]
19,958 reseñas de hotel · 10 idiomas · humano vs GPT-4 · el mismo split congelado 80/20 para todas las familiasFuera de dominio, todos los modelos entrenados se derrumban — ese hallazgo es el caso de estudio.

03Equipo de 4 · NextWave Hackathon (Yuno × Nauta, OpenAI)

PHAROS

Cuando cae la aprobación, encontrá qué cambió.

Un investigador de incidentes de pagos construido en 24 horas: detección estadística sobre un stream en vivo, y un agente de OpenAI encerrado detrás de herramientas de solo lectura y un auditor independiente — tiene que citar evidencia o decir “no concluyente”.

Mi rol: a cargo de la capa de producto — rediseño visual completo, superficies de evidencia, alertas in-app, ingreso al Chaos Lab.

Un incidente sellado hace caer la aprobación de tarjetas 1.6 puntos y se detecta a ciegas en 26 segundos. El agente solo puede llamar a cinco herramientas de solo lectura, cada afirmación pasa por un auditor de evidencia independiente, y la corrida está limitada a diez turnos y falla cerrada — así el reporte cita evidencia o dice que no es concluyente.

El contrato del agente

● corrida ciega

la aprobación cae −1.6 pp — inyección sellada, detectada a ciegas en 26 s

OpenAI agent→ solo puede llamar a5 herramientas · solo lectura · schema estricto
cada afirmación →auditor de evidencia independiente· máximo 10 turnos, fail-closed
así el reporte eshallazgos citadoso, honestamente,“no concluyente”
Datos de pago sintéticos a propósito — lo que importa es el loop de investigación, no el dataset.

04Equipo de 3 · Midnight Hack Buenos Aires

ProofMatch

Hacé match antes de revelar.

Matching laboral privacy-first sobre Midnight Network: probar compatibilidad salarial en zero knowledge sin que ninguna de las dos partes revele su número — la cadena nunca compara los dos secretos. Construido en 48 horas.

Mi rol: escribí los contratos Compact y toda la suite de tests; coordiné al equipo y las releases.

Privado

On-chain

Presupuesto del empleador E

$ ▓▓▓▓▓

 

cmt: 9f2a…c41d

Pretensión del candidato C

$ ▓▓▓▓▓

 

cmt: 5b77…e08a

Piso salarial público

—

 

floor: public

cada parte prueba C ≤ floor y floor ≤ E

✓ match garantizado — los números nunca se comparan
Circuitos ZK reales en Compact sobre Midnight — los commitments que se muestran son ilustrativos.

¿Necesitás un sitio web para tu negocio?

Los diseño y construyo de punta a punta — precio cerrado, acordado antes de empezar.

Empezar un proyecto →