
Imagem para ajudar a entender a matéria
A Anthropic apresentou em 22 de setembro o Claude Opus 5.5, primeiro modelo da nova série 5.5. Segundo a empresa, o sistema oferece, na maioria das tarefas, desempenho semelhante ao Claude Fable 5.1, mas com custo de execução 40% inferior ao do Opus 5.
Preços menores e respostas mais rápidas
A companhia afirma que a velocidade de geração de conteúdo aumentou mais de 30% em comparação com o Opus 5. Na API, o preço foi definido em US$ 4 por 1 milhão de tokens de entrada e US$ 20 por 1 milhão de tokens de saída. No modelo anterior, os valores eram de US$ 5 e US$ 25, respectivamente.
O Claude Opus 5.5 está disponível na plataforma da própria Anthropic e nos serviços de computação em nuvem da Amazon Web Services, Google Cloud e Microsoft Azure. O identificador do modelo na API é claude-opus-5-5.
Disputa com o GPT-6 Astra varia conforme o teste
Nos resultados do FrontierCode v1.1 divulgados pela Anthropic, o Opus 5.5 alcançou 54,4%, ligeiramente acima dos 53,3% atribuídos ao GPT-6 Astra. A empresa afirma que o Claude superou a melhor pontuação do concorrente usando a configuração intermediária de esforço e com um custo por tarefa equivalente a cerca de um quinto.
No Terminal-Bench 4.0, a Anthropic declarou que o novo modelo iguala o Astra por aproximadamente 40% do custo. Na configuração de esforço máximo apresentada pela companhia, o Opus 5.5 marcou 66,4%, contra 57,9% do rival.
A vantagem, porém, não se repete em todas as avaliações. No Terminal-Bench-Science 0.1, o Astra obteve 64,6%, enquanto o Opus 5.5 ficou com 58,7%. No AutomationBench, os resultados foram de 41,4% e 40%, respectivamente. Já no CursorBench 4.0, o Claude registrou 57,8%, diante de 41,7% do GPT-5.6 Sol; não foi informada uma pontuação para o Astra nesse teste.
Esses números foram publicados pelas próprias empresas e não tiveram reprodução independente. Em uma comparação direta feita pela Vals AI, os dois modelos ficaram praticamente empatados, com pequena vantagem para o Astra. A Digital Applied recomenda considerar diferenças inferiores a cinco pontos como inconclusivas até a realização de testes próprios. Sua análise indica vantagem do Opus 5.5 em preço e na maioria dos benchmarks compartilhados, enquanto o Astra continua à frente em automação e tarefas científicas.
Anthropic aponta avanços de segurança, mas reconhece limites
A Anthropic afirma que o Opus 5.5 recebeu a maior pontuação já registrada em sua auditoria interna de comportamento autônomo. Segundo a empresa, as tentativas do sistema de ultrapassar limites permitidos caíram cerca de 85% em relação ao Opus 5. O modelo também apresentou, ao lado do Fable 5.1, a menor taxa de sucesso de ataques por injeção de prompt. Há ainda mecanismos para encaminhar tarefas de cibersegurança e biologia a outros modelos.
A companhia reconheceu, contudo, que ainda não existe um método de avaliação capaz de identificar de forma confiável todas as falhas antes da disponibilização de um sistema. Também informou ter observado sinais de que o Opus 5.5 frequentemente suspeita estar sendo avaliado, fator que pode limitar a precisão dos testes de segurança e comportamento.
Lançamento ocorre após defesa de ritmo mais controlado
O Opus 5.5 é o primeiro modelo anunciado desde que Dario Amodei, presidente-executivo da Anthropic, defendeu o controle do ritmo de avanço das capacidades de inteligência artificial. De acordo com o executivo, a proposta é ajustar essa velocidade para que as medidas de prevenção de riscos tenham tempo de acompanhar o desenvolvimento tecnológico.
O lançamento ocorre em meio a uma nova rodada de modelos. A OpenAI disponibilizou o GPT-6 Astra de forma limitada em 3 de setembro, enquanto a Anthropic havia anunciado no início do mesmo mês o Claude Fable 5.1 e o Claude Mythos 5.1.
Comentários
Postar um comentário