
Imagem para ajudar a entender a matéria
O Google anunciou em 30 de setembro de 2026 o Gemini 4 Argon, novo modelo de inteligência artificial voltado a tarefas complexas de engenharia de software, produção de conhecimento em áreas como direito e finanças e defesa cibernética. A apresentação foi assinada por Koray Kavukcuoglu, vice-presidente sênior do Google DeepMind e arquiteto-chefe de IA da companhia.
Desempenho varia conforme o teste
Segundo o Google, o Argon alcançou 77,9% no DeepSWE v1.1, benchmark de engenharia de software. Em comparação divulgada pelo VentureBeat, Claude Opus 5.5 e GPT-6 Astra registraram, respectivamente, 74,2% e 74,1%. No AutomationBench, dedicado à automação de tarefas profissionais, o modelo do Google ficou em primeiro lugar, com 51,3%.
O Argon também obteve 91,7% no LVBench, avaliação relacionada a vídeo, diante de 87,5% do GPT-6 Astra e 83,7% do Claude Opus 5.5. No benchmark Legal Agent, da plataforma Harvey, os resultados informados foram de 19,6% para o Argon, 5,4% para o GPT-6 Astra e 3,8% para o Claude Opus 5.5.
O novo modelo, porém, não liderou todas as avaliações de desenvolvimento. No FrontierSWE v2, o GPT-6 Astra marcou 65,5%, contra 55% do Argon. O concorrente também ficou à frente no Terminal-Bench Science 0.1, por 68,1% a 57,6%. Já no Terminal-bench 4.0, o Claude Opus 5.5 obteve 66,4%, enquanto o modelo do Google registrou 57,4%.
Avaliações independentes
A Vals AI colocou o Gemini 4 Argon na liderança de seu índice, com 68,90% entre 41 modelos e custo de US$ 15,68 por teste. Claude Sonnet 5.5 e Claude Opus 5.5 apareceram em seguida, com 67,04% e 66,97%, a custos de US$ 21,34 e US$ 32,14 por teste. A entidade informou para o Argon uma precisão de 68,90%, com margem de 0,97 ponto percentual, e latência de 46 minutos e 33 segundos.
Na mesma avaliação, o Argon atingiu 100% no benchmark IOI, empatado com o GPT-6 Astra, e ficou em segundo lugar no Vibe Code Bench e no Code Migration. O modelo liderou a classificação de texto da Arena na categoria “High”, mas apareceu apenas na oitava posição do ranking Best Overall dos dez principais agentes, com 7,92%. Na relação de modelos considerados Pareto eficientes, foi listado com custo de US$ 0,62 por tarefa e desempenho de 7,92%.
Cibersegurança e acesso restrito
No CWE-bench v1, teste de cibersegurança, o Google informou que o Argon e o 3.8 Flash Cyber dividiram a primeira colocação, ambos com 68%. A empresa pretende oferecer uma versão sem as barreiras de segurança cibernética do produto a organizações de defesa consideradas confiáveis e a equipes internas.
Por enquanto, o Argon está sendo liberado gradualmente a algumas organizações de defesa cibernética por meio do Fairwind Program e ainda não tem disponibilidade ampla. O Google afirma que pretende expandir o acesso, começando por clientes pagantes da API e assinantes do Google AI Ultra, antes de alcançar outros desenvolvedores, empresas e consumidores.
Limites e preços
O Google diz ter ampliado de 64 mil para 1 milhão de tokens o limite de saída do Argon. A Vals AI apresenta números diferentes: janela de contexto de 1 milhão de tokens e saída máxima de 262 mil tokens.
No lançamento, a empresa cobrará US$ 2 por 1 milhão de tokens de entrada e US$ 10 por 1 milhão de tokens de saída. Entradas armazenadas em cache terão desconto de 95%. Após o período inicial, os preços passarão a US$ 4 e US$ 20, respectivamente, os mesmos valores-padrão exibidos pela Vals AI. Segundo análise do VentureBeat, o preço promocional corresponde a um quinto do valor anunciado para a API do GPT-6 Astra.
Comentários
Postar um comentário