Oi, eu sou o Marcos
Senior Full-Stack Software Engineer · Agentes de IA, LLM e MCP

Engenheiro full-stack com 17 anos em tecnologia, de servidores de jogo sob DDoS a uma plataforma de agentes que automatiza o processamento de crédito imobiliário nos EUA. Eu entrego o produto inteiro, do front-end em React à infraestrutura na nuvem, e também o que torna um LLM seguro em produção: confidence gates, evals, controle de custo, tracing e ferramentas MCP.

Construindo plataformas de agentes na House NumbersFlorianópolis, Brasil · remoto com times dos EUA
Marcos Kuchak
Fig. 1Marcos Kuchak Filho, Florianópolis, Brasil
Fig. 02Como meus agentes decidem

Todo workflow passa pelos mesmos cinco passos.

Cada ponto é um evento. A maioria nem chega ao modelo. Os que chegam só agem sozinhos com confiança alta, e o resto espera uma pessoa aprovar.

  1. 01Evento5 filas SQS + heartbeat agendado
  2. 02Checagens determinísticasPré-filtros e risk fingerprint pulam a chamada quando nada mudou
  3. 03Handler de LLMSlots multi-provider, fallback Anthropic → OpenAI → Google
  4. 04Confidence gateConfiança alta age sozinha, o resto espera um humano
  5. 05Ação + audit log14 tipos de ação, aprovação à prova de execução dupla
agent-service · pipelinesimulado
Fig. 2Eventos simulados passando pelo pipeline real.
anos em tecnologia
desde 2009
workflows de IA em produção
proativos e reativos
ferramentas MCP com OAuth 2.1
usadas por Claude, GPT e Cursor
de corte no custo de LLM
no workflow mais caro
PRs mergeados em 12 meses
em 12 repositórios
usuários em poucas semanas
SEO para uma startup de mídia viral
Capítulo 01O fio condutor

O mesmo trabalho há 17 anos. Com ferramentas diferentes.

Eu sigo sendo contratado para fazer coisas instáveis se comportarem.

Em 2009 eram servidores de jogo sob ataque DDoS. Depois vieram picos de tráfego viral, celulares sem sinal, runtimes na edge em que ninguém confiava ainda.

Agora são modelos de linguagem. É o componente instável mais útil com que já trabalhei, e a engenharia em volta dele é onde eu passo os meus dias.

DDoS→Picos virais→Offline-first→Edge→LLMs
Capítulo 02Como eu construo agentes

Sete regras que aprendi colocando LLMs em produção

Nenhuma veio de um post de blog. Cada uma veio de um bug, de uma fatura ou de um alerta às 3 da manhã.

  1. Determinístico primeiro, LLM depois

    Se o código consegue responder, o modelo não é chamado. Pré-filtros descartam loans sem sinal, e um risk fingerprint pula a chamada quando nada mudou desde a última execução.1

  2. Confidence gates, não autonomia cega

    Ações com confiança alta rodam sozinhas. O resto cai no inbox de um processor para aprovação, com audit log nos dois casos. Alguns workflows nunca enviam nada sozinhos, por design.2

  3. Fonte de verdade vence prompt esperto

    Quando os agentes começaram a inventar explicações do tipo "X bloqueia Y", a solução não foi um prompt maior. Eu dei a eles uma ferramenta que retorna os bloqueios reais e uma regra para verificar antes de sequenciar.3

  4. Evals nascem em produção

    Toda alucinação que chega a uma pessoa vira fixture. Asserções determinísticas pegam o óbvio, LLM-as-judge cobre o resto, e as duas rodam em casos reais.4

  5. Rastreie cada chamada, precifique cada token

    Cada execução registra o custo dividido em cinco partes. Um worker verifica a cada hora as execuções que deveriam ter rodado e não rodaram, porque a falha que você não vê é a mais cara.5

  6. Dê menos ao modelo

    Contexto menor é mais barato, mais rápido e mais seguro. Cortar um workflow de ~70K para ~2K tokens por passo também fechou um caminho em que credenciais de portal chegavam ao provedor de LLM.6

  7. Entregue dormente, faça um cutover sem graça

    Feature flags por tenant, por loan e por usuário. O sistema legado continua rodando em paralelo. O dia do cutover deveria ser o dia mais sem graça do projeto.7

Capítulo 03Trabalhos selecionados

Sistemas que eu desenhei e mantenho

A maior parte roda na House Numbers, uma fintech de San Francisco que automatiza o processamento de crédito imobiliário com agentes de IA.

Matéria 01 / 06House Numbers2025 – hoje

Uma plataforma de agentes, do zero a 13+ workflows

Um serviço agnóstico de framework que consome cinco filas SQS e passa todo workflow pelo mesmo pipeline: checagens determinísticas, um handler de LLM, um confidence gate e uma ação auditada.

  • Workflows proativos, como um briefing diário que classifica cada loan ativo em FIRE, AT-RISK, WATCH ou Monitor
  • Workflows reativos para email com mutuários e lenders, triagem de inbox e recuperação de documentos
  • 14 tipos de ação num executor registry, com aprovações atômicas que não executam duas vezes
  • Workers de heartbeat e de expectativa que detectam execuções que silenciosamente nunca aconteceram
TypeScriptNode.jsExpressMastraAWS SQSECS FargateMongoDB
13+
workflows em produção
5
filas de eventos SQS
14
tipos de ação
Matéria 02 / 06House Numbers2026

Um gateway MCP que agentes conseguem usar de verdade

Um microserviço OAuth 2.1 que expõe dados de loans para Claude, GPT e Cursor via Model Context Protocol. Streamable HTTP stateless, ferramentas por escopo, discovery RFC 9728 e rate limit no Redis.

  • Nomes e schemas padronizados em ~90 ferramentas, para os agentes pararem de adivinhar qual parâmetro significa "qual loan"
  • Um response shaper que reduziu o payload das ferramentas em ~80% praticamente sem perda de informação
  • Correção da interoperabilidade OAuth com o Claude Code CLI
  • Uma suite de 39 testes de integração que só mocka as fronteiras externas reais
MCPOAuth 2.1ClerkRedisTerraformKubernetes
44% → <10%
taxa de falha em tool calls
~90
ferramentas MCP
−80%
tamanho do payload
Matéria 03 / 06House Numbers2026

Custo e observabilidade de LLM desde o início

Um pacote de preços para Anthropic, OpenAI e Google, um wrapper de tracing com custo dividido em cinco partes, uma API de traces e um dashboard em React. Depois eu usei tudo isso para deixar a plataforma mais barata.

  • Pré-filtro determinístico e risk fingerprint no workflow que era ~36% do gasto com LLM
  • Slots de modelo por workflow com até quatro fallbacks, validados no startup
  • Opus → Sonnet num workflow de alto volume, ~5x mais barato em ~93 chamadas por dia
  • Alertas de falha no Slack e correção de um bug que inflava as métricas em 2x
AnthropicOpenAIGeminiNew RelicReactRecharts
80–85%
de corte no workflow mais caro
~5x
mais barato após troca de modelo
~70K
chamadas MCP inúteis/tenant/ano eliminadas
Matéria 04 / 06House Numbers2025

Um microserviço de auditoria em uma semana

Desenhei, construí e coloquei no ar um serviço de changelog orientado a eventos, com criptografia AES-256-GCM por campo para dados pessoais, e depois integrei em cinco serviços e no web app.

  • ~19,5 mil linhas no PR de fundação, em produção via Terraform e ECS na mesma semana
  • Filtros de metadata com tipos inferidos e uma camada de consulta JSON:API
  • Feed de atividades com geolocalização por IP, parsing de dispositivo e scroll infinito
Node.jsMongoDBTerraformECSReact
1 semana
da ideia à produção
5
serviços integrados
AES-256
criptografia de PII por campo
Matéria 05 / 06House Numbers2025

Busca instantânea em qualquer campo do loan

Algolia de ponta a ponta, com chaves seguras por tenant, 18 réplicas virtuais para ordenação, sincronização em tempo real pelo message bus e fallback automático para o MongoDB.

  • Busca híbrida entre cliente e servidor com destaque de match e previews ricos
  • Um sistema de entity events agnóstico de provedor, para o índice mudar sem mexer nos serviços
AlgoliaMongoDBReact
3–10s → 50–100ms
tempo de busca
18
réplicas virtuais
Matéria 06 / 06Trinnix AI2024 – 2025

Um framework multi-agente, antes dos frameworks

Como tech lead numa startup de agritech, construí um framework de agentes agnóstico de provedor, com adapters para OpenAI, Anthropic e Gemini, agentes verticais especializados e handoffs em background, antes de os frameworks de agentes em TypeScript amadurecerem.

  • Uma ferramenta de BI conversacional que renderiza gráficos ao vivo dentro do chat, para o agricultor consultar a operação em linguagem natural
  • Monorepo TypeScript com arquitetura hexagonal: 30% menos duplicação, entregas 40% mais rápidas
  • Login sem senha com OTP que aumentou a retenção em 25%
TypeScriptNext.jsFastifytRPCPostgreSQLLangChain
+40%
velocidade de entrega
+25%
retenção
Capítulo 04Trajetória

De servidores de jogo a agentes

Deslize →
2009 – 2014 · Infra

Gamehaus

SysOps Engineer
Ijuí, Brasil

Mantive servidores de jogos online de pé. Mitigação de DDoS com proxies em instâncias EC2 escaladas dinamicamente, migrações entre sete provedores de infraestrutura, 99,9% de uptime.

2014 – 2017 · Web

Independente

Full-Stack Developer
Florianópolis, Brasil

Projetos web e de e-commerce de ponta a ponta, da primeira conversa com o cliente até a produção. PHP, Laravel, Node.js.

2017 – 2019 · Escala

Media Innovation Solutions

Senior Full-Stack Developer
Porto Alegre, Brasil

Conteúdo viral em escala. SEO para apps React que trouxe mais de 1M de usuários em poucas semanas, e uma ferramenta que ajustava o gasto em anúncios do Facebook e do Google em tempo real pelo ROI.

2020 – 2023 · Mobile

EXEC Technologies

Senior Software Engineer
Florianópolis, Brasil

Consultoria para vários clientes. Um e-commerce em React Native que superou o site mobile em 35% de conversão e 20% de ticket médio, e um app de pesquisa offline-first que reduziu erros de digitação em mais de 90%.

2022 · Edge

Unijuí

Bacharelado em Ciência da Computação
TCC

Um chat em tempo real rodando inteiro em serverless na edge com Durable Objects, quando isso ainda era experimento.

2024 – 2025 · Agentes

Trinnix AI

Lead Full-Stack Engineer
Remoto

Tech lead de um produto de agritech. Construí um framework multi-agente e uma ferramenta de BI conversacional com um time espalhado por Brasil, EUA, Inglaterra, Índia e Paquistão.

2025 – hoje · Plataforma de IA

House Numbers

Senior Full-Stack Engineer
San Francisco, remoto

Arquitetei a plataforma de agentes, o gateway MCP e a camada de custo e observabilidade por trás do processamento de crédito imobiliário assistido por IA.

Capítulo 06Escrita

Notas de campo

Textos longos sobre o que funciona de verdade com agentes em produção.

Em breve

  1. Confidence gates: deixando agentes agirem sozinhos sem perder o sonoAgentes
  2. Cortando 80% do custo de LLM sem trocar de modeloCusto
  3. Desenhando ferramentas MCP que agentes conseguem chamarMCP
  4. Seu agente não precisa da senhaSegurança
Todos os posts →
Stack

O que eu uso

IAAnthropic●OpenAI●Gemini●MCP●Mastra●LangChain●RAG e embeddings●Evals●LLM-as-judge●Full-stackTypeScript●Node.js●React●Next.js●React Router●Express●Fastify●tRPC●Zod●DadosPostgreSQL●MongoDB●Redis●Algolia●AWS SQS●RabbitMQ●InfraAWS●ECS Fargate●Lambda●Terraform●Docker●Cloudflare Workers●GitHub Actions●New Relic●MobileReact Native●Expo ●
Última página

Construindo algo com agentes?

Eu gosto de conversar sobre arquitetura de agentes, MCP, evals e custo de LLM. Manda uma mensagem.

Formação
Bacharel em Ciência da Computação, Unijuí (2022)
Idiomas
Português (nativo) · Inglês · Espanhol
Base
Florianópolis, Brasil