Anthropic lança Claude Sonnet 5.5 com foco em desempenho e redução de custos

Anthropic lança Claude Sonnet 5.5 com foco em desempenho e redução de custos

Imagem para ajudar a entender a matéria

A Anthropic apresentou em 28 de setembro de 2026 o Claude Sonnet 5.5, nova versão de seu modelo de inteligência artificial. A empresa destaca avanços em testes de desempenho, maior velocidade e melhor relação entre capacidade e custo.

Segundo a desenvolvedora, o Sonnet 5.5, mesmo configurado para níveis baixo ou médio de esforço computacional, consegue superar os melhores resultados do Sonnet 5 com um custo por tarefa aproximadamente dez vezes menor.

Preços e disponibilidade

O modelo será identificado na API como claude-sonnet-5-5 e estará disponível pela Claude Platform e pelos serviços de nuvem da AWS, Google Cloud e Microsoft Azure. Também haverá suporte a configurações que não armazenam os dados processados.

O preço foi definido em US$ 2 por 1 milhão de tokens de entrada e US$ 10 por 1 milhão de tokens de saída. A leitura de informações armazenadas em cache custará US$ 0,20 por 1 milhão de tokens, enquanto a gravação terá preço de US$ 2,50.

De acordo com o site VentureBeat, os valores são iguais aos do GPT-6 Sol e ficam abaixo dos cobrados pelo Claude Opus 5.5, de US$ 4 pela entrada e US$ 20 pela saída. O SiliconANGLE informou que o Sonnet 5.5 produz respostas 30% mais rapidamente que a geração anterior e utiliza menos tokens, o que reduziria o custo efetivo em cerca de 30%.

Resultados variam conforme a tarefa

Nos testes divulgados pela Anthropic, o Sonnet 5.5 alcançou 70,6% no Terminal-Bench 4.0, diante de 10,3% do Sonnet 5 e 66,4% do Opus 5.5. No FrontierCode 1.1 Main, com esforço máximo, marcou 46,2%: acima dos 42,4% do Sonnet 5, mas abaixo dos 54,4% do Opus 5.5 e dos 49,3% do GPT-6 Sol.

No GDPval-AA v2.1, o novo modelo recebeu 1.844 pontos, praticamente empatado com os 1.846 do Opus 5.5 e à frente dos 1.449 do Sonnet 5 e dos 1.487 do GPT-6 Sol. No Humanity's Last Exam, registrou 64,5%, contra 54,9% do antecessor e 67,7% do Opus 5.5. Já no OSWorld 2.1, obteve 80,1%, acima dos 57% do Sonnet 5 e ligeiramente abaixo dos 81,8% do Opus.

A própria Anthropic reconhece que o Opus 5.5 continua claramente mais forte em atividades complexas e abertas que exigem julgamento contínuo. Nas tabelas da empresa, o modelo mais caro superou o Sonnet 5.5 em avaliações como FrontierCode, CursorBench, GDPval-AA, AA-Briefcase e Humanity's Last Exam.

Avaliações independentes

A Artificial Analysis atribuiu ao Sonnet 5.5 uma pontuação de 56 em seu Intelligence Index. O resultado colocou o modelo em terceiro lugar entre 216 avaliados e bem acima da mediana de 26 pontos.

O custo medido pela instituição foi de US$ 7,60 por tarefa. O modelo gerou 410 milhões de tokens de saída durante a avaliação, ante uma mediana de 88 milhões, comportamento classificado pela Artificial Analysis como muito prolixo. A velocidade chegou a 141,9 tokens por segundo, a 28ª melhor do levantamento, mas o tempo até o primeiro token foi de 353,32 segundos.

Na avaliação da Vals AI, o Sonnet 5.5 ficou em segundo lugar entre 66 modelos, com índice de 69,22% e margem de 0,96 ponto percentual. O Opus 5.5 liderou com 69,69%, diferença de 0,47 ponto, mas apresentou custo maior por teste: US$ 32,77, ante US$ 20,80 do Sonnet.

O desempenho não foi uniforme. O Sonnet 5.5 ficou em 31º lugar entre 41 modelos no CyberBench, com 59,58%, e em 36º entre 70 participantes no Harvey's Legal Agent Benchmark, com apenas 2,92%.

Testes em empresas e mecanismos de segurança

Yashodha Bhavnani, vice-presidente da Box citada pelo VentureBeat, afirmou que o modelo foi 2,4 vezes mais rápido e consumiu 12% menos tokens no total. Um diretor de inteligência artificial da Zendesk disse ao SiliconANGLE que o processamento de chamados ficou 20% mais rápido. O site também informou que esta foi a primeira versão da linha Sonnet a concluir o jogo Pokémon Red usando somente imagens da tela.

A Anthropic advertiu que seus mecanismos de segurança biológica podem bloquear por engano algumas solicitações relacionadas a microbiologia e virologia. As restrições também podem ser acionadas em temas de cibersegurança, biologia e conteúdo sensível, embora, segundo o SiliconANGLE, a maior parte das atividades de desenvolvimento de software e ciências da vida não deva ser afetada.

Source: Original Korean article - Trendy News Korea

Comentários