O que aconteceu
A Anthropic lançou o Claude Sonnet 5.5 em 28 de setembro de 2026, segundo o anúncio oficial da empresa. O preço ficou idêntico ao do Claude Sonnet 5, modelo cujo reajuste de preço a própria Anthropic já havia cancelado antes: US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída, com cache read a US$ 0,20/milhão e cache write a US$ 2,50/milhão.
A novidade central não está no preço, está no desempenho. De acordo com a Anthropic, o Sonnet 5.5 é o modelo Sonnet mais rápido já lançado pela empresa até hoje: gera output mais de 30% mais rápido e custa até 30% menos por tarefa, na comparação direta com o Sonnet 5.
No Terminal-Bench 4.0, teste que avalia desempenho em coding agentic dentro de um ambiente de terminal, o Sonnet 5.5 pontuou 70,6%, contra 10,3% do Sonnet 5. Testadores iniciais citados pela própria Anthropic reforçam esse padrão de ganho em eficiência. A Balyasny Asset Management relatou uso de cerca de 121.000 tokens por resposta em tarefas financeiras, contra 497.000 tokens do Sonnet 5 para tarefas equivalentes. Já a Box relatou resultados 2,4 vezes mais rápidos, com 12% menos tokens totais usados. É um ganho pontual, específico da carga de trabalho da Box, maior que a média de “mais de 30% mais rápido” que a Anthropic usa como número geral para o lançamento.
| Métrica | Claude Sonnet 5.5 | Claude Sonnet 5 |
|---|---|---|
| Data de lançamento | 28/09/2026 | - |
| Preço entrada (por milhão de tokens) | US$ 2 | US$ 2 |
| Preço saída (por milhão de tokens) | US$ 10 | US$ 10 |
| Cache read (por milhão de tokens) | US$ 0,20 | US$ 0,20 |
| Cache write (por milhão de tokens) | US$ 2,50 | US$ 2,50 |
| Terminal-Bench 4.0 | 70,6% | 10,3% |
| Velocidade de output | +30% mais rápido | referência |
| Custo por tarefa | até 30% menor | referência |
| Tokens por resposta (Balyasny, tarefas financeiras) | ~121.000 | ~497.000 |
| Velocidade (Box) | 2,4x mais rápido | referência |
| Tokens totais (Box) | 12% menos | referência |
A cobertura especializada que replicou o anúncio, Decrypt e Unite.AI, repete os mesmos números e destaca a manutenção do preço do Sonnet 5 combinada com o salto de velocidade e eficiência como o ponto central do lançamento. Vale o alerta: até agora, essas coberturas reproduzem os dados divulgados pela própria Anthropic, sem benchmark independente publicado fora da empresa.
Por que isso importa
O lançamento do Sonnet 5.5 chega poucos dias depois de o Google lançar o Gemini 4 Argon reivindicando liderança em benchmarks sobre GPT-6 Astra e Claude Opus 5.5, como já cobrimos em outro post deste blog. A disputa entre Google, OpenAI e Anthropic por quem detém o modelo mais avançado virou rotina em 2026. Lançamentos quase sempre são seguidos por um ciclo de resposta do concorrente em semanas, às vezes em dias.
Nesse contexto, a Anthropic optou por uma estratégia específica com o Sonnet 5.5. Em vez de disputar o topo absoluto de benchmarks gerais, território que a própria empresa reserva ao Opus, ela reforçou o Sonnet como o modelo de uso prático e agentic, especialmente em coding. O salto no Terminal-Bench 4.0 e os relatos de early testers como Balyasny e Box sugerem que o foco foi eficiência de execução, não apenas pontuação em benchmark isolado.
Para quem usa IA para programar, isso importa de forma direta. Um modelo que executa tarefas de coding agentic em terminal com muito mais consistência reduz a necessidade de intervenção manual, de retrabalho e de chamadas repetidas ao modelo para corrigir erros. Isso tem efeito prático em dois eixos: velocidade de entrega e custo operacional, já que o preço por token permanece igual, mas o número de tokens necessários por tarefa cai.
O que o Terminal-Bench mede, e por que o salto de 10,3% para 70,6% é relevante
O Terminal-Bench 4.0 avalia a capacidade de um modelo de operar como agente dentro de um ambiente de terminal: interpretar comandos, navegar em sistemas de arquivos, executar scripts e corrigir o próprio curso quando algo falha, sem a mediação constante de um humano. É um teste pensado para medir coding agentic, não apenas geração de código isolada em um editor.
A diferença entre 10,3% (Sonnet 5) e 70,6% (Sonnet 5.5) é grande demais para ser um ganho incremental: é um salto de categoria. Um modelo que acerta pouco mais de 1 em cada 10 tarefas agentic em terminal tende a precisar de supervisão humana constante. Um modelo que acerta mais de 7 em cada 10 começa a viabilizar fluxos de trabalho em que o agente opera com autonomia real por períodos mais longos, antes de precisar de correção.
O que a redução de tokens por tarefa significa em custo prático
Os números da Balyasny (121.000 tokens contra 497.000 do Sonnet 5, para tarefas financeiras equivalentes) e da Box (12% menos tokens totais) apontam para o mesmo fenômeno: o modelo chega à resposta certa com menos iterações.
Como o preço por token de entrada e saída não mudou, essa queda no volume de tokens consumidos se traduz diretamente em economia de custo por tarefa, consistente com a cifra de “até 30% menos por tarefa” citada pela Anthropic. Em escala, para empresas que rodam milhares de tarefas agentic por dia, a diferença entre gastar 121.000 ou 497.000 tokens por resposta pesa diretamente na fatura de uso da API, na mesma linha do esforço que a Anthropic já vinha fazendo para cortar o custo de rodar agentes em produção.
O que observar agora
Vale acompanhar três frentes nas próximas semanas:
- Se a Anthropic vai estender ganhos semelhantes de eficiência para o Claude Opus, hoje citado como referência de topo em benchmarks gerais, mas não coberto pelos números deste lançamento.
- Como laboratórios concorrentes, Google e OpenAI, vão reagir: o padrão recente tem sido de resposta rápida, com novos modelos ou atualizações de preço.
- Se avaliações independentes de Terminal-Bench e de benchmarks de coding agentic, feitas fora da própria Anthropic, confirmam a magnitude do salto reportado no anúncio oficial e replicado pela imprensa inicial.
Perguntas frequentes
O Claude Sonnet 5.5 ficou mais caro que o Sonnet 5?
Não. O preço por token é idêntico: US$ 2 por milhão de tokens de entrada, US$ 10 por milhão de saída, US$ 0,20/milhão para cache read e US$ 2,50/milhão para cache write. A economia vem da redução no volume de tokens necessários por tarefa, não de uma mudança na tabela de preços.
O que é o Terminal-Bench 4.0 e por que o resultado do Sonnet 5.5 chamou atenção?
É um teste que mede a capacidade de um modelo de agir como agente dentro de um ambiente de terminal, executando e corrigindo tarefas de coding com autonomia. O Sonnet 5.5 pontuou 70,6%, contra 10,3% do Sonnet 5, um salto que indica mudança relevante na confiabilidade do modelo em tarefas agentic, não apenas um ganho marginal.
Esse lançamento tem relação com a disputa entre Google, OpenAI e Anthropic por liderança em IA?
O lançamento acontece dias depois de o Google reivindicar liderança em benchmarks com o Gemini 4 Argon, em um momento de disputa intensa entre os principais laboratórios. A Anthropic não comenta essa disputa diretamente no anúncio do Sonnet 5.5, mas o momento do lançamento e o foco em eficiência de coding agentic se encaixam nesse cenário mais amplo de corrida entre empresas.