Pular para o conteúdo
Inteligëncia Artificial

Claude Sonnet 5.5 estreia mais rápido e promete reduzir custos em até 30%

7 min
Anthropic Claude

A Anthropic anunciou o Claude Sonnet 5.5, segundo integrante da família Claude 5.5 e sucessor direto do Sonnet 5. A nova versão mantém a proposta de ser uma alternativa mais rápida e econômica ao Claude Opus 5.5, mas chega com ganhos expressivos em programação, tarefas de conhecimento e trabalhos que exigem várias etapas.

Segundo a empresa, o modelo consegue gerar respostas mais de 30% mais rápido que o Sonnet 5 e, embora mantenha o mesmo preço por milhão de tokens, pode reduzir em até 30% o custo de determinadas tarefas por precisar de menos tokens para concluí-las.

A Anthropic posiciona o Sonnet 5.5 principalmente para atividades bem definidas do cotidiano, correção de bugs e criação de documentos, apresentações e planilhas. Já o Opus 5.5 continua sendo apresentado como a opção indicada para trabalhos mais complexos e abertos, nos quais é necessário sustentar julgamento por períodos maiores.

Além dos ganhos de eficiência, os números divulgados pela companhia mostram avanços consideráveis em alguns testes, especialmente relacionados a programação. Em determinadas avaliações e níveis de esforço, o Sonnet 5.5 chega a se aproximar do Opus 5.5, embora a própria Anthropic ressalte que seu modelo mais avançado continua superior em tarefas complexas e pouco estruturadas.

Programação é um dos principais avanços

O maior salto apresentado pela Anthropic aparece em tarefas de programação executadas por agentes de IA.

No Terminal-Bench 4.0, avaliação voltada a tarefas profissionais complexas realizadas por meio de terminal, o Sonnet 5.5 obteve 70,6%, contra 10,3% do Sonnet 5. A própria tabela divulgada pela empresa coloca o Opus 5.5 em 66,4% nessa avaliação, embora os resultados tenham sido registrados com diferentes configurações de esforço.

Testes do Claude Sonnet 5.5 no Terminal-Bench 4.0

No FrontierCode 1.1, o Sonnet 5.5 marcou 46,2% em sua configuração Max, enquanto o Sonnet 5 alcançou 42,4% e o Opus 5.5 ficou em 54,4%. Já no CursorBench 4.0, a diferença para o Opus ficou menor: 55,5% para o Sonnet e 57,8% para o modelo superior.

A Anthropic afirma que os avanços também aparecem na forma como o modelo utiliza ferramentas. Testadores iniciais relataram que o Sonnet 5.5 conseguiu compreender bases de código mais rapidamente e agrupar chamadas de ferramentas, reduzindo a quantidade de etapas necessárias para concluir determinados trabalhos.

Sonnet 5.5 se aproxima do Opus em tarefas de conhecimento

A companhia também apresenta avanços em atividades que vão além da programação.

No GDPval-AA, voltado a trabalhos encontrados em diferentes profissões e setores, o Sonnet 5.5 registrou 1.844 pontos, praticamente empatando com os 1.846 do Opus 5.5. O Sonnet 5 anterior marcou 1.449 pontos no mesmo quadro apresentado pela Anthropic.

Em reconhecimento de gráficos, medido pelo Chartography, o novo modelo alcançou 61,6%, contra 15,6% do Sonnet 5 e 64,4% do Opus 5.5. No OSWorld 2.1, relacionado ao uso de computadores, os resultados divulgados foram de 80,1% para o Sonnet 5.5 e 81,8% para o Opus.

A Anthropic afirma que testadores também perceberam melhorias menos fáceis de medir em benchmarks, incluindo conversas consideradas mais naturais e maior capacidade de trabalhar com design e apresentações.

Em um teste interno descrito pela empresa, o modelo recebeu materiais de resultados financeiros de uma companhia pública, transcrições de uma teleconferência e um modelo de apresentação. A partir desse conjunto, produziu uma apresentação de dez slides que dois avaliadores consideraram pronta para uso sem alterações.

Mesmo preço por token, mas menor custo por tarefa

O Sonnet 5.5 mantém a tabela de preços do Sonnet 5.

A cobrança informada é de US$ 2 por milhão de tokens de entrada e US$ 10 por milhão de tokens de saída. Leituras de cache custam US$ 0,20 por milhão de tokens, enquanto as gravações de cache ficam em US$ 2,50.

A redução de custo anunciada pela Anthropic, portanto, não acontece por uma queda direta no preço unitário. A empresa argumenta que o novo modelo precisa gerar e processar menos tokens para realizar o mesmo trabalho, o que poderia tornar a execução de determinadas tarefas até 30% mais barata.

Ao mesmo tempo, a velocidade de geração aumentou em mais de 30%, segundo os testes internos. A combinação desses dois fatores forma a principal proposta do Sonnet 5.5 em relação ao antecessor: executar tarefas com maior desempenho sem elevar o preço-base da API.

Níveis de esforço ajustam velocidade e qualidade

O modelo também trabalha com diferentes níveis de esforço, recurso utilizado para equilibrar qualidade, velocidade e custo.

Nos aplicativos do Claude e no Claude Code, o nível padrão é Medium. Já na Claude Platform, o padrão é High. Configurações mais baixas fazem o modelo responder mais rapidamente e consumir menos tokens, enquanto opções mais altas aumentam o tempo dedicado ao raciocínio e à verificação do próprio trabalho.

Segundo a Anthropic, em alguns benchmarks o Sonnet 5.5 configurado em Low ou Medium conseguiu superar o melhor resultado do Sonnet 5 utilizando aproximadamente um décimo do custo por tarefa. Em níveis maiores de esforço, o novo modelo pode se aproximar do desempenho do Opus 5.5, mas também passa a operar com custos semelhantes em determinadas situações.

Isso reforça a divisão apresentada pela própria empresa entre os dois modelos: Sonnet para trabalhos nos quais velocidade, custo e capacidade precisam estar mais equilibrados, enquanto Opus permanece direcionado às tarefas mais exigentes.

Novo Sonnet também recebe proteções adicionais

A Anthropic também ampliou os mecanismos de segurança utilizados no Sonnet.

Segundo a companhia, os avanços do modelo em cibersegurança foram suficientes para que o Sonnet 5.5 se tornasse o primeiro da linha Sonnet a estrear com proteções e mecanismos de fallback semelhantes aos empregados nos modelos mais avançados da empresa.

Solicitações convencionais relacionadas a desenvolvimento de software e correção de vulnerabilidades continuam disponíveis. Em atividades consideradas de maior risco na área de cibersegurança, entretanto, o sistema poderá recorrer ao Sonnet 5 como fallback.

O modelo também passa a utilizar classificadores destinados a dificultar ataques de destilação, técnica na qual grandes volumes de interações são utilizados para tentar reproduzir as capacidades de outro modelo.

Claude Sonnet 5.5 já está disponível

O Claude Sonnet 5.5 já está disponível nas plataformas da Anthropic, além de serviços de nuvem de terceiros citados pela empresa, incluindo Amazon Web Services, Google Cloud e Microsoft Azure.

Para desenvolvedores, o identificador apresentado pela Anthropic na Claude Platform é claude-sonnet-5-5. A empresa também informa disponibilidade com retenção zero de dados.

A família Claude 5.5 ainda deverá ganhar outro integrante. Segundo o anúncio, o Claude Haiku 5.5 está previsto para chegar nas próximas semanas, com foco em aplicações de alto volume e cenários nos quais o custo é uma prioridade.

Com o Sonnet 5.5, a Anthropic busca diminuir a distância entre seus modelos intermediário e topo de linha em várias tarefas sem eliminar a divisão entre eles. Os números apresentados mostram que o Sonnet pode chegar bastante perto do Opus em avaliações específicas, mas a própria empresa continua colocando o Opus 5.5 à frente quando o trabalho exige maior autonomia, julgamento e raciocínio sustentado.

Mais em Inteligência Artificial

Ver tudo sobre Inteligência Artificial →

Compartilhar

Redação

Escrito por