Google apresenta Gemini 3.8 Live com avatar em tempo real e suporte a 97 idiomas

Google apresenta Gemini 3.8 Live com avatar em tempo real e suporte a 97 idiomas

Imagem para ajudar a entender a matéria

Google amplia recursos de inteligência artificial multimodal

O Google anunciou o Gemini 3.8 Live with Live Avatar, uma nova versão de sua tecnologia de inteligência artificial capaz de processar voz e vídeo em tempo real. A empresa informou, em 24 de setembro de 2026, que o sistema oferece sincronização de voz entre diferentes idiomas com suporte a 97 línguas.

O recurso também inclui o uso do SynthID, marca d’água desenvolvida pelo Google para identificar conteúdos gerados por inteligência artificial.

Disponibilidade para empresas e APIs

Segundo o Google, o Gemini 3.8 Live with Live Avatar já está disponível no Gemini Enterprise. O Google Cloud informou que a versão foi lançada oficialmente em 25 de setembro e pode ser acessada por clientes corporativos por meio do console Gemini Enterprise e da Gemini Live API em endpoints dos Estados Unidos e da União Europeia.

A plataforma também oferece opções de capacidade provisionada. A criação de avatares personalizados para o Live Avatar, porém, está atualmente limitada a clientes incluídos em uma lista de permissões empresarial.

Modelos, preços e avaliações independentes

O modelo divulgado pelo Google Cloud é identificado como Gemini 3.8 Live. A empresa não informou um identificador separado para a versão com avatar. O Gemini 3.8 Live Extended Thinking permanece em fase de prévia privada.

O Google Cloud não publicou preços específicos para a nova ferramenta e direcionou usuários para páginas de preços do Gemini Enterprise e do Agent Platform. Dados divulgados pela DataCamp indicam valores de referência de US$ 3 por milhão de tokens para entrada de áudio, US$ 12 para saída de áudio, US$ 0,75 para entrada de texto e US$ 4,50 para saída de texto.

A divulgação do Google não apresentou benchmarks próprios ou comparações diretas com concorrentes. Avaliações independentes apontaram resultados diferentes conforme o critério analisado. No Speech to Speech Index da Artificial Analysis, o Gemini 3.8 Live Extended Thinking obteve 82,6 pontos na configuração High, enquanto a versão padrão Gemini 3.8 Live registrou 76,0 pontos.

Outros testes também mostraram diferenças entre modelos. No indicador de sucesso em tarefas, o Gemini 3.8 Live Extended Thinking teve resultado de 89,1%, enquanto o Gemini 3.8 Live alcançou 93,2%. Em outro levantamento citado pela DataCamp, o modelo Extended Thinking registrou 68,6% no teste τ-Voice, próximo ao GPT-Live-1 Astra, com 67,9%.

Limitações ainda apontadas por avaliações externas

Especialistas e plataformas de avaliação destacaram que os resultados variam conforme a métrica utilizada. Dados citados pelo BeInCrypto indicaram desempenho superior do Qwen Audio 3.0 em um teste específico de raciocínio por voz, enquanto outras avaliações apontaram vantagem para modelos Gemini em determinados critérios de preferência humana.

A DataCamp também apontou limitações da linha Gemini 3.8 Live, incluindo possibilidade de respostas incorretas, necessidade de evolução na resistência a ataques de jailbreak e eventuais problemas de velocidade ou tempo de resposta.

O lançamento ocorre em meio à disputa entre grandes empresas de tecnologia pelo avanço de modelos multimodais, que combinam diferentes tipos de entrada, como texto, áudio e vídeo, em uma única experiência de inteligência artificial.

Source: Original Korean article - Trendy News Korea

Comentários