Custo por conversa de um agente de IA: como calcular tokens, modelo e volume (sem susto na fatura)
A pergunta não é “quanto custa a IA”. É quanto custa cada conversa — e o que faz esse número subir sem você perceber. Aqui eu abro a conta do jeito que ela aparece na prática.
O custo de um agente de IA se mede por conversa, e a fórmula é simples: tokens consumidos × preço do modelo, multiplicado pelo volume de conversas. Cada palavra que o agente lê (instrução, histórico, dados da empresa) e cada palavra que ele escreve vira token, e o provedor cobra por isso. Na maioria dos atendimentos de texto, uma conversa custa de centavos a poucos reais — o que estoura a fatura não é a IA em si, é volume alto somado a um modelo caro usado onde não precisava.
Eu opero agentes de IA em produção todos os dias, com conta chegando no fim do mês. Então vou te mostrar como esse custo se forma de verdade, onde ele vaza e como derrubá-lo sem perder qualidade na resposta.
- Custo = tokens × preço do modelo × volume de conversas.
- Token é cada pedaço de texto que o agente lê e escreve — tudo conta.
- O que mais infla a conta: histórico longo, base inteira no contexto e modelo caro em tarefa simples.
- Antes de cortar custo, meça o custo por conversa. Sem isso, você corta no escuro.
O que é token (e por que ele define a conta)
Token é a unidade que o modelo processa. Em português, grosso modo, um token é uma palavra curta ou um pedaço de uma palavra longa — “pedido” pode ser um token, “inteligência” pode virar dois ou três. Os provedores de IA cobram de dois jeitos: tokens de entrada (tudo que o agente recebe para responder) e tokens de saída (tudo que ele gera). A saída costuma custar mais caro que a entrada.
Aqui está o detalhe que pega quase todo mundo: a cada nova mensagem numa conversa, o agente reenvia o contexto inteiro — a instrução, o histórico anterior e os dados que ele consultou. Ou seja, numa conversa longa, você paga o começo dela de novo a cada resposta. É por isso que o custo não é por “pergunta”, é por conversa, e conversas arrastadas custam desproporcionalmente mais.
Como calcular o custo por conversa
A conta de uma única resposta tem três blocos de tokens de entrada mais um de saída:
- Instrução do agente (system prompt): as regras de comportamento. Vão junto em toda resposta. Veja como escrever a instrução de um agente de IA enxuta.
- Histórico da conversa: as mensagens trocadas até ali. Cresce a cada turno.
- Dados consultados: trechos do catálogo, política de troca, histórico do cliente — o que a base de conhecimento (RAG) injeta no contexto.
- Saída: a resposta que o agente escreve.
Para estimar o mês: multiplique o custo médio por conversa pelo número de conversas. É isso. A matemática é trivial — o difícil é não deixar cada bloco crescer sem controle. Um agente bem construído mantém a instrução curta, corta o histórico antigo e injeta só o trecho relevante da base; um mal construído manda a política inteira de 20 páginas em toda mensagem e paga por isso mil vezes por dia.
- Conversa média de atendimento: ~6 a 10 trocas.
- Pegue o preço por token de entrada e de saída do seu modelo (na tabela oficial do provedor).
- Custo da conversa = (total de tokens de entrada × preço entrada) + (total de tokens de saída × preço saída).
- Custo mensal = custo por conversa × volume de conversas no mês.
Não invente o número: pegue o preço na fonte oficial e rode a sua realidade. O objetivo aqui é você entender o que multiplica, não decorar um valor que muda toda hora.
O que infla a conta sem você perceber
Na prática, quase todo custo fora de controle vem de quatro lugares:
- Instrução inchada: um system prompt de milhares de palavras que vai em toda resposta. Enxugar aqui reduz custo em cada mensagem, o dia inteiro.
- Histórico sem limite: conversas que carregam 50 mensagens de contexto quando as últimas 6 bastavam.
- Base inteira no contexto: jogar documentos completos em vez de recuperar só o parágrafo que responde à pergunta. É o erro mais comum e o mais caro.
- Modelo caro em tarefa boba: usar o modelo mais potente para classificar “é dúvida ou é reclamação?”. Isso é pagar carro de luxo para ir à padaria.
O custo de um agente raramente explode por volume de verdade. Explode porque ninguém mediu o custo por conversa — então o desperdício ficou invisível até a fatura chegar.
Qual modelo usar para não pagar demais
O erro de principiante é escolher um modelo só e usá-lo em tudo. Operação boa usa o modelo certo para cada etapa: um modelo barato e rápido para triar, classificar e responder o simples; um modelo mais capaz só onde o raciocínio e a persuasão valem o preço — fechar uma venda, contornar uma objeção, lidar com um caso sensível. A diferença de preço entre modelos é grande, e na etapa simples o barato entrega igual. Se você ainda está decidindo, eu comparo as opções em GPT, Claude ou Gemini para o agente da sua empresa.
Esse roteamento — mandar cada tipo de tarefa para o modelo adequado — é o que separa uma conta saudável de uma conta assustadora com a mesma qualidade de resposta.
Como reduzir o custo sem perder qualidade
- Enxugue a instrução: toda palavra a mais no system prompt é paga em cada resposta. Corte o que não muda o comportamento.
- Limite o histórico: mande só as últimas trocas relevantes, não a conversa inteira.
- Recupere, não despeje: injete o trecho exato da base que responde — não o documento todo.
- Roteie por modelo: barato nas etapas simples, caro só onde o resultado justifica.
- Use cache: partes que se repetem (instrução, dados fixos) podem ser cacheadas por vários provedores, barateando a entrada repetida.
- Meça por conversa: acompanhe custo por conversa como métrica fixa. É o que torna o desperdício visível — pilar da observabilidade do agente.
Custo não é despesa — é o denominador do ROI
O número que importa não é o custo por conversa isolado. É ele dividindo o que a conversa gera. Um agente que custa R$ 2 por conversa e recupera uma venda de R$ 300 tem um retorno que nenhuma planilha de “economia de token” captura. Por isso eu sempre olho o custo contra o resultado: quanto o agente recupera, agenda ou resolve. Se você quer dimensionar o investimento inteiro — não só o operacional — veja quanto custa implementar IA e agentes numa empresa no Brasil, e se a dúvida é fazer internamente ou contratar, build vs. buy para agentes de IA.
Cortar token é ótimo. Mas cortar token a ponto de o agente responder pior e perder venda é o pior negócio que existe. A meta é a conta mais enxuta que mantém o resultado — não a mais barata possível. Se quiser ver como isso se conecta à decisão de onde a IA deve (e não deve) entrar, leia também onde a IA NÃO deve ser usada no seu negócio.
Perguntas frequentes
Quanto custa rodar um agente de IA por mês?
O custo mensal é o custo por conversa multiplicado pelo volume de conversas. O custo por conversa vem dos tokens consumidos (entrada mais saída) vezes o preço do modelo escolhido. Em atendimento de texto, a maior parte dos negócios opera na casa de centavos a poucos reais por conversa — o que faz a conta subir é volume alto somado a um modelo caro usado onde não precisava.
Como calcular o custo por conversa de um agente de IA?
Some os tokens de entrada (instrução do agente, histórico da conversa e dados consultados) e os de saída (as respostas), multiplique cada bloco pelo preço por token do modelo e some. Conversas mais longas, históricos grandes e muitos documentos injetados no contexto aumentam os tokens e, portanto, o custo.
O que é token e por que ele define o custo?
Token é o pedaço de texto que o modelo processa — em português, grosso modo, cerca de uma palavra curta ou parte de uma palavra longa. Os provedores de IA cobram por token de entrada e por token de saída. Como tudo que o agente lê e escreve vira token, o total de tokens é o que determina a fatura.
Vale a pena usar o modelo mais barato para economizar?
Depende da tarefa. Para triagem, classificação e respostas simples, um modelo mais barato resolve e corta custo. Para raciocínio, objeções de venda e casos sensíveis, o modelo mais capaz costuma pagar o preço maior em conversão e menos erro. O caminho é usar o modelo certo para cada etapa, não o mais barato em tudo.
Como reduzir o custo de um agente de IA em produção?
Enxugue a instrução do agente, limite o histórico enviado a cada resposta, injete só os trechos relevantes da base de conhecimento (em vez de documentos inteiros), use modelo mais barato nas etapas simples e cache o que se repete. Antes de cortar, meça o custo por conversa — não dá para reduzir o que não se mede.