Se você desenvolve produtos usando LLMs, é muito provável que seu system prompt esteja sofrendo de uma doença silenciosa: o acúmulo de contexto (prompt bloat).
Conforme os modelos evoluem, adicionamos regras e instruções para corrigir falhas pontuais. O problema é que, quando uma nova geração de modelos é lançada, essas correções continuam lá, gastando tokens de entrada a cada nova interação da API.
Em um painel recente da Y Combinator, Boris Cherny, criador do Claude Code na Anthropic, revelou uma estratégia contraintuitiva: ao migrar para modelos mais recentes, eles deletaram mais de 80% do system prompt da ferramenta.
Abaixo, reunimos os principais aprendizados técnicos dessa palestra para você aplicar no seu fluxo de desenvolvimento e economizar milhares de tokens.
1. O Teste de Ablação: Apague tudo antes de otimizar
O erro mais comum ao criar system prompts é a abordagem cumulativa: o modelo falha em um caso de borda, adiciona-se uma linha; falha em outro, adiciona-se uma regra. Em pouco tempo, o prompt inicial se torna uma lista gigante de restrições.
Lembre-se de que o system prompt é reenviado à API em todas as mensagens de uma sessão. Um prompt de 3.000 tokens em uma conversa de 50 turnos significa consumir 150.000 tokens apenas repetindo as instruções base.
Como resolver
Aplique o teste de ablação:
- Ao atualizar a versão do modelo (ou periodicamente a cada poucos meses), zere o system prompt.
- Teste o comportamento da aplicação sem nenhuma instrução prévia.
- Adicione regras de volta linha por linha, apenas quando o modelo falhar de forma consistente e demonstrar que realmente precisa daquela instrução específica.
Se o modelo atualizado for mais inteligente, ele provavelmente já absorveu o comportamento sem precisar que você o relembre a cada instrução.
2. Abandone a "Superespecificação" (Over-specifying)
Desenvolvedores acostumados com programação tradicional tendem a instruir a IA em formato algorítmico: "Faça a etapa 1, depois a etapa 2, valide com a regra X e formate como Z".
Modelos avançados lidam mal com instruções procedimentais extensas. Além de inflarem a contagem de tokens, elas limitam a capacidade de raciocínio do modelo.
A estrutura ideal de prompt
Em vez de desenhar o passo a passo, estruture suas instruções focando em três pilares:
- Objetivo Claro: O resultado final esperado.
- Restrições (Guardrails): O que a IA definitivamente não pode fazer.
- Critério de Conclusão (Exit Criteria): Como a IA sabe que a tarefa foi finalizada com sucesso.
Deixar o modelo decidir o caminho interno consome drasticamente menos tokens do que marchar com ele passo a passo.
3. Troque instruções extensas por Loops de Verificação
Tentar prever todos os erros no prompt de entrada gera documentos gigantescos. Uma abordagem muito mais eficiente e barata em termos de tokens de contexto é dar à IA a capacidade de testar o próprio trabalho.
Em vez de colocar 5 páginas de especificações de interface no prompt para refatorar um código, forneça uma ferramenta de teste e uma instrução simples:
"Execute o código, rode a suíte de testes unitários (ou compare a tela gerada) e não pare até que todos os testes passem."
Isso desloca o custo de tokens do processamento passivo de contexto longo para um loop de feedback focado. O prompt inicial permanece enxuto, e o modelo gasta tokens apenas ajustando o que errou.
4. Defina uma rotina de limpeza de contexto
Da mesma forma que refatoramos código antigo para eliminar dead code, o contexto fornecido às IAs (como arquivos de instrução do repositório, skills e hooks) precisa passar por faxinas periódicas.
Adote a regra dos 6 meses: revise todos os arquivos de contexto do projeto. Tente remover arquivos inteiros de orientação e veja se a performance cai. Na maioria das vezes, você descobrirá que os modelos mais novos não precisam mais de metade das "muletas" criadas no passado.
Conclusão
Economizar tokens não é apenas uma questão de otimização de custos; é sobre eficiência de raciocínio. Quanto menor e mais limpo for o contexto inicial, menor a chance de o modelo se perder em instruções conflitantes ou irrelevantes.
Na próxima vez que for atualizar a integração da sua IA, experimente pressionar o botão de deletar antes de escrever uma nova regra.
