Quem usa o Claude Code com o Opus 5.5 ou o Fable 5 no dia a dia já sentiu o peso das execuções longas na cota e no consumo de tokens atingirem a sua cota de 5 horas ou até semanal rapidamente. Por isso, o lançamento do Claude Haiku 5.5 em 7 de outubro de 2026 chama atenção imediatamente.
Com entrada a partir de US$ 0,10 por milhão de tokens e janela de 1 milhão de tokens, ele passa a ser usado para subagents e tarefas rápidas. No entanto, consultando a documentação oficial de prompting, fica claro que o modelo exige ajustes específicos de prompt e de effort para não parar na metade do trabalho ou pular a verificação do código.
Neste artigo, reuni os pontos principais da documentação da Anthropic e traduzi os padrões de prompt mais úteis para quem trabalha com agentes de código, automação e API. Além disso, destaco as pegadinhas de custo e de prompt caching que você precisa considerar antes de atualizar seus fluxos.
Onde o Claude Haiku 5.5 entra na família atual
Pela ficha técnica oficial, o Claude Haiku 5.5 (claude-haiku-5-5) foi projetado para tarefas de alto volume e baixa latência, como classificação, roteamento, extração de dados e execução de subagents. Ainda assim, ele herda recursos que antes ficavam restritos aos modelos maiores da família 5.5.
Veja como ele se posiciona na tabela comparativa da própria Anthropic para prompts de até 100 mil tokens:
| Modelo | Janela de contexto | Saída máxima | Preço base (Entrada / Saída por MTok) | Latência | Thinking | Effort padrão |
|---|---|---|---|---|---|---|
| Claude Fable 5.1 | 1M | 128K | US$ 10 / US$ 50 | Mais lenta | Adaptive (sempre ativo) | high |
| Claude Opus 5.5 | 1M | 128K | US$ 4 / US$ 20 | Moderada | Adaptive (sempre ativo) | medium |
| Claude Sonnet 5.5 | 1M | 128K | US$ 2 / US$ 10 | Rápida | Adaptive | high |
| Claude Haiku 5.5 | 1M | 128K | US$ 0,10 / US$ 0,50 | Mais rápida | Adaptive | medium |
Há dois detalhes na tabela de preços que merecem leitura atenta. Primeiro, a tarifa de US$ 0,10 na entrada e US$ 0,50 na saída vale para requisições de até 100 mil tokens; acima desse volume, o preço passa para US$ 0,50 na entrada e US$ 2,50 na saída por milhão de tokens (Fonte). Segundo, o modelo usa o novo tokenizador introduzido a partir do Claude 4.7. Na prática, o mesmo texto gera cerca de 30% mais tokens do que no Haiku 4.5 (Fonte).
Para o meu fluxo, isso reforça a ideia de que o Haiku 5.5 é o candidato ideal para rodar como operário em subagents no Claude Code. Enquanto o Opus 5.5 ou o Sonnet 5.5 coordena a arquitetura principal, o Haiku 5.5 pode varrer diretórios, rodar triagem de issues ou validar pacotes com fração do custo, desde que o contexto de cada subagent fique abaixo de 100 mil tokens.
O parâmetro effort no Claude Haiku 5.5 e a pegadinha do cache
O Claude Haiku 5.5 é o primeiro modelo da linha Haiku com suporte a níveis de effort e adaptive thinking ativado por padrão. Com isso, o antigo parâmetro budget_tokens do Haiku 4.5 deixa de existir e retorna erro na API (Fonte).
De acordo com o guia de prompting da Anthropic, você pode escolher entre os seguintes níveis:
low: é a opção mais rápida e barata, indicada para chat, chamadas curtas de ferramentas e alto volume. Porém, em prompts longos de agentes, o modelo tem mais chance de pular buscas, parar cedo demais ou ignorar testes.medium: é o padrão na Claude API e no Claude Code. A documentação recomenda começar por aqui na maioria das tarefas, incluindo programação agêntica.high: indicado para trabalho de conhecimento, tarefas longas de agentes e aderência estrita a instruções.xhighemax: voltados para casos em que suas avaliações (evals) comprovem ganho real. Como o tempo de resposta e o volume de tokens crescem bastante nesses níveis, a própria Anthropic sugere comparar o resultado diretamente com o Claude Sonnet 5.5.
O impacto oculto nos tokens e no prompt caching
Minha leitura é que o controle de effort concentra as maiores armadilhas de custo na migração para o Haiku 5.5. Consultando a documentação, três comportamentos exigem atenção:
- O raciocínio consome
max_tokens: o adaptive thinking vem ligado por padrão. Se você mantiver ummax_tokenscurto herdado do Haiku 4.5, o modelo pode gastar todo o limite pensando e cortar a resposta final antes de gerar texto (Fonte). - A troca de
lowparamediumdobra a saída: segundo os testes da Anthropic, subir o effort delowparamediumsem alterar o prompt reduziu as paradas precoces pela metade. Por outro lado, essa mudança mais que dobrou a quantidade de tokens de saída em cada tentativa (Fonte). - Mudar o effort invalida o cache: alterar o parâmetro
effortno topo da requisição entre um turno e outro invalida o prompt cache das mensagens da conversa. Para mudar o esforço no meio de uma conversa mantendo o cache, é necessário usar a configuração por mensagem com o header betamid-conversation-output-config-2026-07-01e manter o adaptive thinking ativo (Fonte).
Além disso, não adianta escrever no prompt “responda diretamente” para economizar tokens de raciocínio. Nos testes da Anthropic, pedir resposta direta em texto não impediu o Haiku 5.5 de pensar. Se você realmente precisar desligar o raciocínio (permitido apenas em low, medium e high), passe thinking: {"type": "disabled"} na chamada da API.
Como evitar paradas precoces e falta de testes em agentes de código
Quando usamos um modelo leve em subagents ou tarefas de código, dois problemas costumam gerar retrabalho humano: o agente devolver a tarefa incompleta ou afirmar que o código está pronto sem ter executado um único teste.
A documentação do Claude Haiku 5.5 mostra que isso ocorre com frequência quando combinamos um system prompt longo de agente com o nível low (e, no caso dos testes, também no medium). Felizmente, ajustar o system prompt ou o CLAUDE.md resolve boa parte desse comportamento sem exigir um salto para modelos mais caros.
1. Evitando paradas no meio da tarefa (early stopping)
Se o seu agente para cedo demais e devolve o controle antes de concluir o pedido, a Anthropic recomenda adicionar esta instrução ao system prompt (Fonte):
Continue trabalhando até que tudo o que o usuário pediu esteja concluído,
e pare para perguntar apenas quando não puder prosseguir sem o usuário
ou antes de uma etapa arriscada.
Quando o trabalho solicitado estiver concluído e verificado, pare e reporte.
Não adicione novas funcionalidades, documentação ou refatorações que não
foram pedidas. Se achar que algo ajudaria, mencione no final em vez de fazer.Code language: PHP (php)
O detalhe que muda a forma de começar é a segunda parte do bloco. Ela evita o extremo oposto: quando você pede para o modelo não parar cedo, ele pode tentar inventar refatorações extras. Limitar o escopo mantém o consumo de tokens previsível.
2. Exigindo verificação real de código
Nos níveis low e medium, o Haiku 5.5 às vezes reporta uma alteração como concluída sem exercitar o código modificado. Para forçar uma validação real, inclua este parágrafo nas instruções do seu agente (Fonte):
Quando alterar código que pode ser executado, compilado ou checado por tipos,
rode uma verificação real que exercite a mudança antes de reportar como pronto:
os testes do projeto, o type-checker, o build ou o próprio comando alterado.
Uma checagem apenas de sintaxe, ou um comando que falhou ao iniciar, não conta;
se faltarem apenas as dependências declaradas do projeto, instale-as com o
gerenciador de pacotes e lockfile do próprio projeto (ex.: npm install,
pip install -r requirements.txt), nunca via sudo ou pelo gerenciador do sistema,
a menos que receba instrução contrária. Apenas se nenhuma verificação real puder
rodar aqui, diga qual você não rodou e por quê, em vez de reportar como pronto.Code language: JavaScript (javascript)
Minha sugestão é usar esse bloco sempre que delegar tarefas de WordPress ou Node.js para um subagent rodando Haiku 5.5. O modelo gasta mais tokens rodando o teste, mas economiza o tempo que você perderia revisando um código quebrado.
Saída em JSON com ferramentas, busca e mensagens mid-turn
Para quem integra o Claude Haiku 5.5 via API em pipelines de conteúdo, suporte ou automação, o guia oficial aponta três comportamentos técnicos que diferem de versões anteriores.
JSON estruturado junto com tool calling
Se você desligar o thinking (disabled) e pedir saída estruturada em JSON enquanto oferece ferramentas próprias, o modelo pode pular a chamada de ferramenta que precisava fazer (Fonte).
Para resolver isso, a recomendação principal é manter o adaptive thinking ligado. Caso precise manter o thinking desligado por questão de latência, adicione esta regra ao system prompt:
O formato de saída JSON aplica-se apenas à sua resposta final.
Quando precisar de uma ferramenta, chame-a primeiro, sem texto antes da chamada,
e escreva o JSON apenas quando tiver os resultados.Code language: JavaScript (javascript)
Buscas atualizadas sem desperdício de chamadas
O corte de conhecimento confiável do Haiku 5.5 é junho de 2026 (Fonte). Ao fornecer uma ferramenta de busca, informe sempre a data atual no system prompt (The current date is {{current_date}}.).
Em system prompts longos ou no effort low, a Anthropic notou que o modelo às vezes hesita em buscar fatos recentes. Por outro lado, instruções amplas demais (como “busque qualquer pergunta factual do presente”) fizeram o modelo acionar a busca em metade das perguntas que não precisavam disso. O ajuste equilibrado testado pela equipe deles, que adicionou buscas desnecessárias em apenas 0% a 3% dos casos, é este (Fonte):
Seus dados de treinamento terminam bem antes da data de hoje. Registros,
ocupantes de cargos, preços, versões, regras e qualquer informação "mais recente"
podem ter mudado desde então; por isso, busque esses dados antes de responder,
mesmo quando tiver certeza. Fatos que não mudam não precisam de busca. Quando a
resposta depender de onde o usuário está, inclua o país ou região na busca.Code language: JavaScript (javascript)
Mensagens no meio da execução e recusas de segurança
Outro ponto importante para quem constrói harnesses de agentes: o Haiku 5.5 foi treinado para resistir a prompt injection vindo do retorno de ferramentas. Por isso, se o usuário enviar uma mensagem no meio de uma tarefa e sua aplicação injetar esse texto dentro de um bloco tool_result, o modelo pode tratá-lo como conteúdo não confiável e ignorar a instrução (Fonte). Entregue sempre a fala do usuário como um bloco de texto separado após o último tool_result.
Por fim, assim como vimos no Opus 5.5 e no Fable 5.1, o Haiku 5.5 conta com classificadores de segurança que podem recusar requisições com stop_reason: "refusal" nas categorias cyber, frontier_llm, bio e general_harms (Fonte). A diferença crítica aqui é que o Haiku 5.5 não possui server-side fallback automático. Ou seja, seu código cliente precisa tratar o stop_reason: "refusal" diretamente, pois reenviar a mesma mensagem apenas repetirá a recusa.
Teste prático: validando este post com um subagent no Claude Code
Para colocar as duas recomendações do guia à prova no meu próprio repositório de conteúdo, criei o subagent .claude/agents/seo-content-validator.md apontando para model: claude-haiku-5-5.
No system prompt dele, combinei a regra da Anthropic contra paradas precoces com a instrução de verificação real via Bash:
---
name: seo-content-validator
description: Valida o frontmatter dos arquivos do repositório com o script oficial e audita critérios de SEO e legibilidade Yoast em um rascunho.
tools: Read, Bash, Grep, Glob
model: claude-haiku-5-5
---
Você é um subagent validador de conteúdo técnico e SEO.
Continue trabalhando até que tudo o que o usuário pediu esteja concluído,
e pare para perguntar apenas quando não puder prosseguir sem o usuário
ou antes de uma etapa arriscada. Quando o trabalho solicitado estiver
concluído e verificado, pare e reporte. Não adicione novas funcionalidades,
documentação ou refatorações que não foram pedidas. Se achar que algo
ajudaria, mencione no final em vez de fazer.
Quando validar um rascunho do repositório, rode uma verificação real antes
de reportar como pronto: execute `./venv/bin/python scripts/validate_content.py`
via Bash e confira se o código de saída é 0. Uma checagem apenas visual do YAML
não conta. Apenas se nenhuma verificação real puder rodar aqui, diga qual você
não rodou e por quê, em vez de reportar como pronto.Code language: PHP (php)
A fricção real com ferramentas MCP e o resultado da execução
Na primeira tentativa de rodar o subagent pelo terminal, esbarrei em um erro 400 da API: tools.140.custom.input_schema: input_schema does not support oneOf, allOf, or anyOf at the top level. Como meu ambiente tem vários servidores MCP conectados, o Claude Code tentou carregar mais de 140 ferramentas na sessão do subagent, e uma delas tinha um schema incompatível com a validação estrita da API.
Para resolver isso e ainda economizar milhares de tokens de prefixo, isolei a execução passando --strict-mcp-config com uma configuração vazia de MCP:
claude --agent seo-content-validator \
--strict-mcp-config --mcp-config '{"mcpServers":{}}' \
--allowedTools "Read,Bash,Grep,Glob" \
-p "Valide o rascunho rascunhos/pt/claude-haiku-5-5-prompt-effort-subagents.md"Code language: JavaScript (javascript)
O Claude Haiku 5.5 concluiu a tarefa em 13,6 segundos ao longo de 4 turnos, consumindo 2.855 tokens de saída, 40.920 tokens de gravação de cache (TTL de 1 hora do Claude Code) e 70.629 tokens de leitura de cache nos turnos seguintes.
Dois comportamentos chamaram minha atenção na resposta real do modelo:
- Ele executou o script Python antes de opinar: no primeiro turno, rodou
./venv/bin/python scripts/validate_content.py, confirmou o código de saída0nos 108 arquivos do repositório e só então auditou o arquivo Markdown. - Seguiu à risca a regra de escopo: após entregar a tabela com os 11 itens de SEO e formatação validados, encerrou com a seguinte observação: “Fora do escopo da checagem, o texto cita muitos números e comportamentos do modelo, como preços, janela de contexto, +30% de tokens e a redução de paradas precoces. Eu não verifiquei esses dados contra a documentação oficial. Vale conferir antes de publicar.”
Ou seja, exatamente como pedido nos blocos da documentação da Anthropic, o modelo não inventou tarefas extras fora do escopo nem fingiu ter verificado links externos que não estavam na missão dele.
Resumo prático: quando vale usar o Haiku 5.5
Depois de analisar a documentação e rodar esse teste no terminal, minha conclusão é que o Claude Haiku 5.5 deixa de ser apenas um modelo de classificação simples e passa a ser uma peça estratégica para arquiteturas multi-agentes. Ele entrega janela de 1 milhão de tokens e adaptive thinking por uma fração do preço do Sonnet 5.5 e do Opus 5.5.
Porém, o menor preço por milhão de tokens na tabela não garante a menor conta no fim do mês se você ignorar o aumento de 30% do novo tokenizador, a invalidação do cache ao trocar o effort ou o dobro de tokens gerados entre low e medium. O segredo está em usar o medium como ponto de partida, isolar os servidores MCP que o subagent não precisa usar e blindar o system prompt para exigir verificações reais.
E no seu fluxo com Claude Code ou API, você já costuma separar um modelo mais leve para subagents e tarefas rápidas ou ainda concentra tudo no modelo principal?

Deixe um comentário