
Imagem para ajudar a entender a matéria
Dois modelos para tarefas diferentes
A OpenAI apresentou em 22 de setembro de 2026 os modelos GPT-6 Sol e GPT-6 Luna. Segundo a empresa, ambos receberam técnicas de treinamento semelhantes às usadas no GPT-6 Astra, com o objetivo de levar avanços em trabalho especializado, precisão factual, programação, uso de computadores e alinhamento a sistemas mais rápidos e baratos.
O GPT-6 Sol foi desenvolvido principalmente para tarefas complexas de programação. Já o GPT-6 Luna tem como foco atividades de escritório, produção de resumos e extração de informações.
Preços menores e acesso pelo ChatGPT e Codex
Na API, o GPT-6 Sol custa US$ 2 por 1 milhão de tokens de entrada e US$ 10 por 1 milhão de tokens de saída. A OpenAI afirma que os valores são 50% menores que os preços promocionais do GPT-5.6. No Luna, o preço da entrada caiu de US$ 0,20 para US$ 0,10 por 1 milhão de tokens, enquanto o da saída passou de US$ 1,20 para US$ 0,50.
Os modelos estão disponíveis na API pelos identificadores gpt-6-sol e gpt-6-luna. Eles também começaram a chegar ao ChatGPT Work e ao Codex para assinantes dos planos Plus, Pro, Business, Enterprise e Edu. Usuários dos planos Free e Go podem acessar o Luna pelo aplicativo para computador. Na estreia, porém, os dois modelos ainda não estavam disponíveis no modo Chat, segundo o MacRumors.
O GitHub anunciou uma distribuição gradual no Copilot para VS Code, Visual Studio, terminal, agentes em nuvem, aplicativo do Copilot, site do GitHub, dispositivos móveis, JetBrains, Xcode e Eclipse. O Sol será oferecido nos planos Copilot Pro+, Max, Business e Enterprise. O Luna também estará no Pro.
Ganhos de desempenho vêm acompanhados de ressalvas
Nos testes divulgados pela OpenAI, o GPT-6 Sol alcançou 33,2% no AutomationBench com esforço xhigh e custo de US$ 0,27 por tarefa. No Agents' Last Exam, registrou 56,4% com esforço máximo. No DeepSWE v1.1, o Sol obteve 68,8% e o Luna, 66,6%. O Claude Fable 5, da concorrente Anthropic, chegou a 69,9% nesse último teste.
No OSWorld 2.0 offline, o Sol marcou 60,5%, ante 60,3% do Claude Opus 5. A OpenAI sustenta que o resultado semelhante foi obtido com um custo por tarefa aproximadamente 80% menor. A empresa também afirma que o Luna, na configuração máxima, pode superar o GPT-5.6 Sol em nível médio gastando um décimo do valor.
Em uma avaliação interna de factualidade, a OpenAI diz ter identificado no Sol cerca de metade dos erros observados no GPT-5.6 Sol. O teste utilizou conversas reais sem identificação dos usuários, mas não teve verificação independente apresentada. A própria companhia ressalta que os diálogos foram selecionados por sua propensão a provocar erros e não representam o uso cotidiano. A mesma limitação vale para os testes de agentes e programação, elaborados para situações deliberadamente difíceis.
Avaliações independentes mostram quadro desigual
Nos testes da Artificial Analysis, o Sol subiu de 55 para 57 pontos no Coding Agent Index, enquanto o Luna recuou de 43 para 41. No AA-Omniscience Index, o Sol avançou de 22 para 27 pontos e o Luna, de -10 para 1. A taxa de alucinação medida pelo instituto caiu de 92% para 60% no Sol e de 93% para 77% no Luna.
Também houve avanço no Terminal-Bench 4.0 e no AutomationBench-AA. Em contrapartida, ambos perderam desempenho no GDPval-AA v2.1, com quedas de cerca de 100 pontos Elo para o Sol e 75 para o Luna. No AA-Briefcase v1.1, o Luna recuou aproximadamente 45 pontos, enquanto o Sol permaneceu estável. A Artificial Analysis atribuiu as perdas à piora na qualidade da apresentação e à ausência de elementos exigidos pelos critérios de avaliação, e não a uma redução das capacidades fundamentais.
O instituto calculou custo de US$ 1,06 por tarefa para o Sol na configuração máxima, aproximadamente metade do valor anterior, e de US$ 0,07 para o Luna, uma redução de cerca de 60%. Apesar da economia, o Intelligence Index geral subiu apenas um ponto para o Sol e não mudou para o Luna.
Anthropic lança concorrente no mesmo dia
A Anthropic apresentou o Claude Opus 5.5 cerca de 90 minutos antes do anúncio da OpenAI. Segundo o MacRumors, o modelo superou o GPT-6 Astra em algumas tarefas de programação e trabalho baseado em conhecimento. As diferenças entre os produtos e suas configurações, porém, tornam mais complexa uma comparação direta de custo por tarefa.
Os resultados disponíveis indicam que a nova geração da OpenAI combina preços menores e avanços em parte dos testes de programação com retrocessos em outras avaliações. O desempenho também varia conforme o modelo, a intensidade de processamento escolhida e o tipo de tarefa.
Comentários
Postar um comentário