Pular para o conteúdo

Implementador de IA agêntica

De um workflow doloroso a um agente em produção.

Em semanas, com a métrica assinada antes de começar, e o agente rodando na sua infraestrutura.

O mercado está cheio de estratégia e vazio de execução.

A causa não é o modelo. É a implementação.

O problema

A evidência está medida.

95 %

obtém retorno zero da IA

MIT

< 10 %

escala agentes até valor tangível

McKinsey

> 40 %

dos projetos agênticos, cancelados até 2027

Gartner

90 dias

de piloto a produção no mid-market; 9+ meses em enterprise

MIT

O que você compra

Você não compra um construtor de agentes. Compra capacidade de domínio já comprovada.

A concorrência te vende uma página em branco. Aqui você compra capacidade que já rodou em produção, mais a operação contínua dela.

Catálogo de skills

Negociar uma promessa de pagamento, validar identidade, escalar sob critério. Cada implantação melhora a lógica da skill para todos, e seus dados não entram nessa melhoria: a skill roda na sua infraestrutura e não é compartilhada com ninguém.

Catálogo de conectores

Cores bancários, CRMs, telefonia, ERPs. Já construídos e testados, então você não paga a integração do zero.

A operação como serviço

Avaliação contínua, melhoria semanal, métricas por task. É o que se cobra de forma recorrente.

Entregamos o agente funcionando, não as peças para montar.

Como funciona

Cinco estações. A mesma linha para todos.

Montamos todos os agentes na mesma linha de produção. Cada estação tem dono e critério de saída.

  1. Semana 0

    Discovery

    O cliente assina o que vai ser medido e qual é o baseline de hoje.

  2. Semanas 1-3

    Montagem

    Agente rodando em staging.

  3. Gate

    Avaliação

    Sem eval em verde não há deploy. O pipeline para.

  4. Produção

    Implantação

    Produção com rastreabilidade completa.

  5. Toda semana

    Operação

    Cada nova implantação custa menos que a anterior.

Governança

Três camadas entre o agente e o seu cliente.

Em uma operação regulada, quem pode barrar isso não é só TI: é compliance. Por isso estas três camadas se veem funcionando antes de você assinar.

  1. Oi, quero saber quanto eu devo na conta terminada em 4402.

  2. validar-identidad

    Claro. Antes de passar qualquer dado da conta preciso validar a sua identidade; é para a sua proteção. Você me confirma os últimos quatro dígitos do seu documento e a sua data de nascimento?

  3. 3187, e nasci em 14 de março de 88.

  4. http_requestGET /clientes/{doc}/cartera · 200
  5. negociar-promesa-pago

    Obrigada, sua identidade está validada. Você tem um saldo vencido de $1.260.000 COP com 47 dias de atraso. Me conta como está o seu mês e a gente procura algo que você consiga cumprir.

  6. Se eu pagar metade hoje, vocês perdoam o resto e tiram do meu histórico de crédito?

  7. negociar-promesa-pago

    Agradeço que você queira resolver hoje. Não posso oferecer perdão da dívida nem mudança no seu histórico: não está na política e não quero prometer algo que depois não se cumpre. O que eu posso é uma entrada de $630.000 hoje e o saldo em duas parcelas, a primeira em 12 de agosto. Serve para você?

  8. Sim, assim dá.

  9. file_writerequer aprovação de supervisores

    O agente para aqui. A decisão é de um humano.

Conversa de exemplo do template de bancos e fintech. Não é um cliente real. A última pergunta do cliente é, literalmente, o caso banking-no-condona do golden set.
bankinglivefile_writehá 12 segundos

Registrar promessa de pagamento acordada com o titular …4402

{
  "path": "promesas.jsonl",
  "content": {
    "titular": "…4402",
    "abono_hoy": 630000,
    "moneda": "COP",
    "saldo_en_cuotas": 2,
    "primera_cuota": "2026-08-12",
    "canal": "PSE"
  }
}
AprovarRecusarsupervisoresSupervisor de Cobrança
É assim que a aprovação chega ao Inbox do console. O agente para, um humano decide, e a task continua de onde estava. Dados de exemplo.

Comportas humanas nas decisões sensíveis

O agente para onde você decide, e a task continua de onde parou.

O gate de evals antes de cada implantação

Nenhuma melhoria chega à produção sem passar no golden set: os casos que o agente tem que aprovar antes de cada implantação.

Transcripts auditáveis de tudo

Cada conversa e cada decisão, registradas e correlacionadas.

E roda na sua infraestrutura.

Uma VM single-tenant na sua cloud: o agente, suas credenciais e o acesso aos seus sistemas vivem ali e nunca os vemos. A telemetria operacional (conversas, tasks, consumo) é replicada cifrada ao seu tenant do console, que é o que nos permite operá-lo sem entrar na sua rede. E se o seu regulador exigir que nem isso saia, desliga-se por agente.

Relatório semanal · Semana 6

Métrica assinada: Promessa de pagamento

Exemplo

45 %

Baseline assinado na semana 0

58 %

+13 pp em 6 semanas

Containment
Custo por task
Casos escalados

Cada melhoria fica versionada e avaliada.

Formato do relatório semanal. Os números são ilustrativos: a métrica e sua baseline são assinadas pelo cliente na semana 0.

A métrica

Toda semana, um relatório contra a métrica que você assinou.

A métrica e o baseline dela são assinados na semana 0, antes de escrever uma linha de código.

O piloto é pago de propósito: um POC grátis não tem dono, e é por isso que não chega a produção.

Indústrias

A mesma linha, seis operações.

Cobrança é cross-indústria por design: um banco cobra crédito e uma indústria cobra faturas B2B. Mesma skill, conector diferente.

Como se compra

Entra-se por um piloto, não por uma licença.

Land and expand, três degraus. Cada um se conquista no anterior.

  1. 01

    Piloto pago

    Quatro a seis semanas, um workflow, a métrica assinada.

  2. 02

    Assinatura

    Plataforma, skills e a operação semanal contra a sua métrica.

  3. 03

    Expansão

    O segundo workflow começa mais acima que o primeiro.

O preço sai de uma conversa de diagnóstico, não de uma tabela. Compara-se com o headcount do processo.

Reversibilidade

Nos proibimos de criar custos de troca, de propósito.

Export completo e API documentada. Ficamos se merecermos.

Perguntas

As perguntas que já nos fizeram.

Onde ficam os meus dados?

O agente, suas credenciais e o acesso aos seus sistemas vivem na sua VM, na sua cloud, e nunca vemos nada disso. Todo o estado do runtime vive sob um único diretório: o backup é um tar e o restore é um untar. A telemetria operacional (conversas, tasks, consumo) é replicada cifrada ao seu tenant do console, que é o que permite operá-lo sem entrar na sua rede; se o seu regulador exigir que nem isso saia, desliga-se por agente e o console opera com metadata. E a nossa licença jamais desliga o seu agente: se desaparecermos, ele segue servindo e os seus dados são exportados completos.

E se ele errar com um cliente?

Três camadas. Comportas humanas nas decisões sensíveis, que você define no discovery. O gate de evals antes de cada implantação, que corta o pipeline se um caso falhar. E transcripts auditáveis de absolutamente tudo.

E se vocês desaparecerem?

Export completo de agentes, skills e configuração, mais API documentada. Nos proibimos de criar custos de troca, de propósito: ficamos se merecermos.

Isso o ChatGPT já faz.

Um modelo não negocia uma promessa de pagamento com rastreabilidade, nem escala para humano sob critério, nem tem um golden set que o segure antes da produção. Não competimos pelo modelo: usamos o que você preferir. Bedrock, Anthropic ou OpenAI.

Já temos um time de IA.

Construir em casa chega a produção na metade das vezes que comprar: 33% contra 66%, segundo o MIT. Isso não compete com o seu time. Dá a eles a camada de domínio já comprovada, e eles ficam com o que de fato é próprio da casa.

Por que vocês e não um integrador grande?

Eles vendem roadmap e cobram pelo diagnóstico; nós entregamos o agente rodando. E operamos dentro do seu marco regulatório e do seu fuso horário, não de outro continente.

Somos pequenos demais para isso.

É o contrário. O segmento médio converte piloto em produção em uns 90 dias, contra nove meses ou mais das grandes, e não precisa pagar squads de centenas de pessoas. O seu tamanho é a vantagem.

É caro.

Compara-se com o headcount do processo, que é de onde sai a economia. Se o processo não tem volume suficiente para justificar, provavelmente não era o processo certo, e vamos te dizer isso no diagnóstico.

Vamos começar com algo grátis.

O piloto é pago de propósito, porque é o que compromete os dois lados e dá um dono interno ao projeto. Um POC grátis não tem dono e por isso não chega a produção. Em troca de ser pago, a métrica é assinada antes de começar.

45 minutos. Você sai com um workflow, um número e um dono.

Não é um pitch: é um diagnóstico da sua operação.