A fatura da API de IA chegou outra vez mais alta do que esperavas, e o produto nem cresceu assim tanto. Isto está a acontecer a cada vez mais programadores, agências e criadores de conteúdo em Portugal e no Brasil que passaram de “brincar com o ChatGPT” para ter a IA a correr em produção, dentro de um produto ou de um fluxo de automação.
A boa notícia: a maior parte do desperdício de tokens tem solução técnica simples, sem trocar de modelo nem baixar a qualidade das respostas. Este guia junta as técnicas reais de eficiência de tokens (não achismos) para reduzir essa fatura.

Eficiência de tokens: resposta rápida
As três formas com maior impacto imediato no custo são: usar o modelo mais barato que resolve cada tarefa em vez do mais avançado para tudo (pode cortar 90%+ do custo em tarefas simples), ativar o prompt caching quando repetes o mesmo contexto longo várias vezes (até 90% mais barato nos tokens repetidos, na Anthropic), e mover tarefas sem urgência para uma Batch API (50% de desconto, até 24h de espera). Juntas, estas três técnicas costumam cortar entre 40% a 80% do custo mensal de tokens sem tocar na qualidade do produto final.
O que é um token e porque decide o preço que pagas?
Um token é o pedaço de texto que o modelo processa de cada vez: mais ou menos 4 caracteres em inglês, um pouco menos em português por causa dos acentos e conjugações.
Cada pedido à API tem dois lados a pagar: os tokens de input (o que envias: prompt, histórico da conversa, documentos anexados) e os tokens de output (o que o modelo gera como resposta). O output custa sempre mais caro que o input, normalmente entre 4 a 6 vezes mais, porque gerar texto exige mais computação do que lê-lo. Isto significa que um prompt longo com uma resposta curta é bem mais barato do que um prompt curto que gera uma resposta longa, o oposto do que a maioria das pessoas assume.
Quanto custam os tokens em 2026? Tabela comparativa
Preços por 1 milhão de tokens, verificados diretamente na documentação oficial de cada fornecedor (não em agregadores, que ficam desatualizados com frequência). Os preços de IA mudam com regularidade; confirma sempre no site oficial antes de decidires.
| Modelo | Input (por 1M tokens) | Output (por 1M tokens) |
|---|---|---|
| Claude Haiku 4.5 | $1 | $5 |
| Claude Sonnet 5 | $2 | $10 |
| Claude Opus 5 | $5 | $25 |
| GPT-5.6 Luna (compacto) | $0,20 | $1,20 |
| GPT-5.6 Terra (equilibrado) | $2 | $12 |
| GPT-5.6 Sol (topo de gama) | $5 | $30 |
| DeepSeek-V4-Flash (cache miss) | $0,22–$0,44 | $0,66–$1,32 |
| DeepSeek-V4-Pro (cache miss) | $0,66–$1,32 | $1,98–$3,96 |
O que salta à vista: a diferença entre o modelo mais barato e o mais caro de cada fornecedor é de 10x a 25x. Usar sempre o modelo topo de gama “por segurança” é a forma mais rápida de esvaziar o orçamento de IA sem qualquer ganho real na maioria das tarefas do dia a dia (classificar texto, extrair dados, responder perguntas simples de suporte).
5 técnicas reais de eficiência de tokens para reduzir custos
Nem toda a chamada à API precisa do modelo mais inteligente. Classificar um email como “urgente” ou “não urgente”, extrair um número de telefone de um texto, ou resumir uma frase é trabalho para um modelo compacto como o Claude Haiku 4.5 ou o GPT-5.6 Luna, não para o Opus 5 ou o Sol. Reserva o modelo topo de gama para o que realmente precisa de raciocínio complexo: análise jurídica, geração de código com lógica intrincada, ou decisões com múltiplos passos.
Na prática, isto costuma significar montar um “router” simples: um modelo barato decide primeiro se a tarefa é trivial ou complexa, e só escala para o modelo caro quando necessário.
Se o teu produto envia o mesmo system prompt longo, o mesmo manual de instruções, ou os mesmos documentos de referência em cada chamada (comum em chatbots de suporte ou assistentes com base de conhecimento fixa), o prompt caching da Anthropic reduz o custo desses tokens repetidos em até 90%, de $2/1M para $0,20/1M no caso do Sonnet 5, por exemplo.
A contrapartida: escrever pela primeira vez no cache custa 25% mais do que o normal (ou o dobro, se pedires um cache de 1 hora em vez do padrão de 5 minutos), por isso só compensa quando o mesmo bloco de texto é reutilizado várias vezes num curto espaço de tempo. Documentação oficial com exemplos de código: Prompt Caching da Anthropic.
Se a tarefa não precisa de resposta em tempo real (classificar um lote de 5.000 avaliações de clientes, gerar descrições de produto durante a noite, processar um arquivo de dados), a Batch API da OpenAI (e equivalentes de outros fornecedores) processa os pedidos de forma assíncrona com 50% de desconto sobre o preço normal, com um prazo máximo de 24 horas (na prática, costuma ser bem mais rápido). É a técnica mais simples de todas de aplicar, e a mais frequentemente esquecida por quem só conhece a API síncrona. Mais detalhes: documentação da Batch API da OpenAI.
Num chatbot ou agente que mantém conversa, cada nova mensagem tende a reenviar todo o histórico anterior, o que significa que o custo de cada troca cresce à medida que a conversa avança, mesmo que as primeiras mensagens já não sejam relevantes. Resumir o histórico antigo periodicamente (em vez de o reenviar palavra por palavra), limitar quantas mensagens anteriores entram no contexto, e evitar colar documentos inteiros quando só uma secção é relevante são ajustes simples que costumam cortar 30% a 50% dos tokens de input em conversas longas, sem perda percetível de qualidade.
Como o output custa 4 a 6 vezes mais que o input, um modelo “a divagar” em vez de responder direto ao ponto pesa muito mais na fatura do que um prompt mal otimizado. Definir um limite de tokens de saída (max_tokens), pedir explicitamente respostas curtas ou em formato estruturado (JSON, lista, tabela) em vez de texto corrido, e instruir o modelo a não repetir o que já foi perguntado são ajustes triviais de prompt que reduzem diretamente o custo de output, muitas vezes o maior peso na fatura total.
Vale a pena mudar para um modelo mais barato como o DeepSeek?
Pelos números da tabela acima, o DeepSeek é dramaticamente mais barato que a Claude ou a OpenAI: em alguns casos, 10x a 20x menos por token. Vale a pena para tarefas de alto volume e baixo risco: classificação em massa, extração de dados estruturados, rascunhos internos.
Duas ressalvas honestas antes de migrares tudo, no espírito de uma análise séria de eficiência de tokens e não só de preço por token: a qualidade em tarefas de raciocínio complexo ou em português europeu/brasileiro nuançado ainda tende a ficar atrás dos modelos topo de gama da Anthropic e da OpenAI (vale sempre testar com os teus próprios casos reais, não só acreditar em benchmarks genéricos), e os dados enviados para APIs chinesas levantam questões de privacidade e conformidade (RGPD/LGPD) que precisam de ser avaliadas caso a caso, sobretudo com dados de clientes.
Para volume alto e risco baixo, compensa testar. Para dados sensíveis ou decisões críticas, o custo extra dos modelos ocidentais costuma ser justificado.
Perguntas Frequentes
Tokens de input são o que envias ao modelo (prompt, histórico, documentos); tokens de output são o que o modelo gera como resposta. O output custa normalmente 4 a 6 vezes mais que o input em todos os fornecedores principais.
A Anthropic (Claude) tem prompt caching nativo e bem documentado, com até 90% de desconto nos tokens repetidos. A OpenAI e outros fornecedores têm mecanismos semelhantes com nomes e percentagens diferentes; vale sempre confirmar a documentação oficial do fornecedor que usas antes de assumir a mesma poupança.
A maioria sim: prompt caching, Batch API e model routing exigem acesso direto à API, não à interface de chat normal (ChatGPT.com, Claude.ai). Se usas a IA através de uma plataforma de automação como o Zapier, Make ou n8n, algumas destas técnicas (sobretudo cortar contexto e limitar output) ainda se aplicam ajustando os prompts dentro do próprio fluxo; vale a pena ver também o nosso guia de manutenção de fluxos de IA.
Para resumir
Reduzir o custo de tokens não exige trocar de fornecedor nem baixar a qualidade das respostas. Na maioria dos casos, resolve-se com ajustes técnicos concretos: escolher o modelo certo para cada tarefa, ativar caching quando há contexto repetido, mover o que não é urgente para batch, cortar histórico desnecessário e limitar o output. Se já usas IA em automações ligadas ao teu negócio, este trabalho de otimização junta-se naturalmente ao que já escrevemos sobre o custo oculto de manter um pipeline de IA ligado. A eficiência de tokens é uma das alavancas mais diretas para baixar esse custo total.