Tokens explicados de forma simples
Em resumo
- Um token é um pedaço de palavra, cerca de 3 a 4 caracteres em português.
- Entrada e saída são cobradas separadamente.
A unidade que o modelo lê e que define custo e limite.
Um token é um pedaço de palavra, cerca de 3 a 4 caracteres em português.
Guia completo e atualizadoQuando recebi a primeira fatura de API, achei que tinha sido cobrado errado. Eram poucas mensagens. O que eu não tinha entendido é que cada mensagem carregava um prompt de sistema de duas páginas, e ele era cobrado toda vez. Entender tokens teria me poupado esse susto e alguns reais. Este artigo é a explicação que eu precisava.
Você vai entender o que é um token, por que ele define custo e limite, como estimar quantos tokens tem um texto e três hábitos que reduzem a conta.
O que é um token
Modelos de linguagem não leem letras nem palavras; leem tokens, pedaços de texto de tamanho variável. Em português, um token tem em média três a quatro caracteres. "Relatório" pode virar dois ou três tokens; "de" é um. Emojis, acentos e palavras raras costumam consumir mais tokens que o esperado.
A regra prática que uso: divida o número de caracteres por 3,5. Um texto de 1.000 palavras, com cerca de 6.000 caracteres, tem perto de 1.700 tokens. A calculadora deste site faz essa conta.
Janela de contexto: quanto o modelo lembra
O limite de texto que cabe em uma conversa e como usá-lo bem. →
Por que tokens importam
Dois motivos. Custo: a API cobra por tokens de entrada (o que você envia) e de saída (o que o modelo gera), com preços diferentes, e a saída costuma custar mais. Limite: cada modelo tem uma janela de contexto, o máximo de tokens que cabe em uma conversa, incluindo arquivos, respostas anteriores e o prompt de sistema. Quando estoura, o início é cortado ou a conversa é resumida.
Nos aplicativos de chat você não vê a conta, mas o limite de uso do plano também é, na prática, um limite de tokens. Conversas longas e arquivos grandes esgotam a cota mais rápido.
O custo escondido: o que se repete
Foi o meu erro. Se toda chamada envia o mesmo prompt de sistema de 2.000 tokens, e você faz 1.000 chamadas por mês, são 2 milhões de tokens só de repetição. A saída, que é o que você realmente quer, pode ser uma fração disso. O cache de prompt existe exatamente para isso: o contexto repetido é processado uma vez e reaproveitado por um período, a um custo menor.
Como estimar antes de construir
Tokens médios de entrada por pedido, mais tokens médios de saída, vezes o preço de cada um, vezes o volume mensal, mais 30% de margem para retentativas e crescimento. Faça a conta antes de escrever a primeira linha do sistema.
Três hábitos que reduzem a conta
Encurtar o prompt de sistema: cada frase deve pagar o próprio custo. Limitar a saída: defina o máximo de tokens de resposta; uma classificação não precisa de 500 tokens. Usar modelo menor para etapas simples: triagem, classificação e extração ficam bem em modelos pequenos, e o modelo grande entra só onde a qualidade exige.
No chat, o equivalente é: começar conversas novas por tema, resumir conversas longas e anexar só as partes relevantes de um arquivo grande.
Tokens em arquivos, imagens e PDFs
Arquivos anexados também viram tokens, e é aí que a conta surpreende. Um PDF de 40 páginas pode passar de 30 mil tokens; uma imagem consome uma quantidade que depende da resolução; uma planilha grande, se lida como texto, estoura a janela rápido. Por isso os assistentes processam arquivos grandes por código: só o resultado da análise entra na conversa, não as milhares de linhas.
Na prática: quando a pergunta é sobre uma parte do documento, envie a parte. Quando é sobre o todo, peça o agregado e o número de controle. E em conversas longas com vários anexos, abra um chat novo por tema; o histórico inteiro é reenviado a cada mensagem.
Tokens e qualidade
Mais tokens de entrada não significam resposta melhor. Contexto irrelevante piora a resposta, porque o modelo divide a atenção. O ideal é o mínimo de contexto que contém tudo que a tarefa exige. Peça o agregado, não a leitura linha a linha; envie a seção do contrato, não o contrato inteiro, quando a pergunta é sobre uma cláusula.
O que mudou depois do susto
Cortei o prompt de sistema pela metade, ativei cache para a parte fixa, limitei a saída das etapas de classificação e passei a registrar tokens de entrada e saída de cada chamada. A conta mensal caiu para cerca de um terço, com a mesma qualidade. Hoje, antes de qualquer automação nova, faço a estimativa na calculadora e só depois escrevo o código.
Perguntas frequentes
Um token é uma palavra?
Não. É um pedaço de texto, em média três a quatro caracteres em português. Uma palavra pode ter um ou vários tokens.
Como sei quantos tokens tem meu prompt?
Use a calculadora deste site ou divida os caracteres por 3,5. As APIs também informam a contagem exata em cada resposta.
Entrada e saída custam o mesmo?
Não. A saída costuma custar várias vezes mais que a entrada. Por isso limitar o tamanho da resposta reduz a conta.
No app de chat eu pago por token?
Indiretamente. O limite de uso do plano é consumido mais rápido por conversas longas e arquivos grandes.
Fontes e método
- Documentação de preços e cache de prompt da Anthropic
- Registros próprios de consumo de API, 2025 e 2026
Continue sua pesquisa
Próximos passos selecionados para esta jornada.
Janela de contexto: quanto o modelo lembra
O limite de texto que cabe em uma conversa e como usá-lo bem.
Entender →Claude vs ChatGPT: qual escolher
Comparativo prático entre os dois assistentes mais usados, por tipo de tarefa.
Ver como fazer →Do prompt ao MVP em um dia
Roteiro para tirar uma ideia do papel com IA em poucas horas.
Comparar →