Software e produto

Construo sistemas de IA em que a IA nunca é a fonte da verdade

Quatro projetos: um SaaS de agendamento rodando em produção, pesquisa publicada em machine learning, um agente de incidentes de pagamento construído em 24 horas e matching de vagas em zero-knowledge. Cada um traça um limite explícito sobre o que o software tem permissão para decidir.

* passe o mouse sobre qualquer número — todos citam sua fonte.

01

TurnoBot

De uma mensagem no WhatsApp a um horário confirmado.

Um SaaS de agendamento WhatsApp-first para negócios que trabalham com hora marcada, no ar em produção e aprovado pela Meta. A conversa é uma máquina de estados determinística — sem LLM no loop: a disponibilidade vem de um motor de agendamento puro, e a reserva dupla é impedida dentro do próprio Postgres, com um advisory lock e uma reverificação dentro da transação.

Replay de um agendamento verificado: a mensagem “queria marcar um horário” inicia um fluxo guiado — serviço, profissional (atribuído automaticamente a Agustin), horários reais para sexta-feira 4 de setembro com o fim de semana pulado, confirmação às 17:30 — enquanto um log do motor mostra cada decisão determinística, incluindo o advisory lock do Postgres e a reverificação dentro da transação.

De uma mensagem a um horário marcado

● execução verificada

o que decide — log do motor

Replay de um agendamento end-to-end verificado (2026-09-03). A conversa original foi em espanhol; rótulos simplificados, comportamento do motor real.Rode ao vivo — o mesmo motor do WhatsApp ↗

02com Ciro Vilmer

ReviewLens

Você consegue distinguir uma review humana de uma do GPT-4?

Detecção multilíngue de reviews de hotel geradas por IA em 10 idiomas: sete modelos, um empate estatístico em ~0,94 e um XLM-RoBERTa com fine-tuning que rompeu o teto. A conclusão honesta: os modelos treinados não generalizam — a metodologia sim.

Acurácia no test set held-out por representação: contadores estilométricos 0,839; TF-IDF 0,947, XGBoost 0,945 e redes neurais por idioma 0,940 formam um empate estatístico, um teto perto de 0,94; o XLM-RoBERTa com fine-tuning rompe esse teto em 0,959, com intervalo de confiança de 95% de 0,953 a 0,964.

A escada de representações

21 contadores interpretáveis

Apenas a forma da escrita: pontuação, dígitos, emoji, sinais de comprimento — nenhuma palavra. Só a forma já supera o piso baseado em comprimento e define o primeiro degrau.

0.839 acc · 95% CI [0.828–0.851]
19.958 reviews de hotel · 10 idiomas · humano vs GPT-4 · o mesmo split congelado 80/20 para cada famíliaFora do domínio, todo modelo treinado desmorona — essa constatação é o estudo de caso.

03Equipe de 4 · NextWave Hackathon (Yuno × Nauta, OpenAI)

PHAROS

Quando a aprovação cai, descubra o que mudou.

Um investigador de incidentes de pagamento construído em 24 horas: detecção estatística sobre um stream ao vivo e um agente OpenAI trancado atrás de ferramentas read-only e de um auditor independente — ele precisa citar evidência ou dizer “inconclusivo”.

Meu papel: responsável pela camada de produto — reconstrução visual completa, superfícies de evidência, alertas in-app, login do Chaos Lab.

Um incidente lacrado derruba a aprovação de cartão em 1,6 ponto e é detectado às cegas em 26 segundos. O agente só pode chamar cinco ferramentas read-only, cada afirmação passa por um auditor de evidências independente, e a execução tem limite de dez turnos e falha fechada — então o relatório ou cita evidência ou diz inconclusivo.

O contrato do agente

● execução às cegas

a aprovação cai −1.6 pp — injeção lacrada, detectada às cegas em 26 s

OpenAI agent→ só pode chamar5 ferramentas · read-only · schema estrito
cada afirmação →auditor de evidências independente· máx. 10 turnos, fail-closed
então o relatório éachados com citaçãoou, honestamente,“inconclusivo”
Dados de pagamento sintéticos por decisão — o que importa é o loop de investigação, não o dataset.

04Equipe de 3 · Midnight Hack Buenos Aires

ProofMatch

Dê match antes de revelar.

Matching de vagas com privacidade em primeiro lugar na Midnight Network: provar compatibilidade salarial em zero knowledge sem que nenhum dos lados revele seu número — a chain nunca compara os dois segredos. Construído em 48 horas.

Meu papel: escrevi os contratos Compact e toda a suíte de testes; coordenei a equipe e as releases.

Privado

On-chain

Orçamento do empregador E

$ ▓▓▓▓▓

 

cmt: 9f2a…c41d

Pretensão do candidato C

$ ▓▓▓▓▓

 

cmt: 5b77…e08a

Piso salarial público

—

 

floor: public

cada lado prova C ≤ floor e floor ≤ E

✓ match garantido — os números nunca são comparados
Circuitos ZK reais em Compact na Midnight — os commitments mostrados são ilustrativos.

Precisa de um site para o seu negócio?

Eu projeto e construo do início ao fim — preço fechado, acordado antes de começar.

Começar um projeto →