
Imagem para ajudar a entender a matéria
O Google apresentou, em 23 de setembro de 2026, os modelos Gemini 3.8 Flash TTS e Gemini 3.8 Flash-Lite TTS. As novas ferramentas de conversão de texto em fala têm como principais recursos a personalização de vozes e a reprodução de diferentes sotaques.
Os modelos já estão disponíveis na Gemini API e no Google AI Studio, sob os identificadores gemini-3.8-flash-tts e gemini-3.8-flash-lite-tts. A oferta pela API do Gemini Enterprise será iniciada posteriormente.
Clonagem de voz e identificação de conteúdo por IA
Segundo o site The Next Web, os dois modelos são compatíveis com mais de 100 idiomas e dialetos e oferecem mais de 2 mil vozes pré-configuradas. O Gemini 3.8 Flash TTS também pode replicar uma voz a partir de uma amostra de 30 segundos, após um procedimento de confirmação de consentimento.
A clonagem de voz pelo Google AI Studio não está disponível em Illinois e Texas, nos Estados Unidos, nem no Espaço Econômico Europeu, Reino Unido, Suíça e Índia.
Todo áudio produzido pelos modelos Gemini Audio recebe a marca d'água SynthID, destinada a identificar conteúdo gerado por inteligência artificial. As vozes clonadas também incluem credenciais de procedência do padrão C2PA. O site RuntimeWire observou, porém, que o Google não detalhou no lançamento como funciona a verificação do consentimento nem divulgou números sobre latência e capacidade de uso. Também não havia validação independente desses aspectos.
O Gemini 3.8 Flash TTS pode ser usado por todos os usuários no Gemini Notebook, enquanto o Flash-Lite TTS está disponível no Google Vids.
Resultados variam entre avaliações
O Google afirma que o Gemini 3.8 Flash TTS alcançou a primeira posição no Voice Design Benchmark da Hume AI, com nota geral de 71,4, e também liderou a avaliação de reprodução de sotaques, com 60,8. De acordo com a empresa, Flash TTS e Flash-Lite TTS ficaram, respectivamente, em primeiro e segundo lugares no índice geral de qualidade da Hume AI.
Em testes cegos de preferência da Voice Arena, os modelos apareceram entre os mais bem colocados em japonês, português brasileiro, vietnamita, árabe padrão moderno, espanhol mexicano e hindi. O desempenho em português do Brasil é um ponto relevante para desenvolvedores e empresas que pretendem produzir conteúdo de voz para o público brasileiro.
O RuntimeWire ressaltou que os resultados da Hume citados pelo Google foram divulgados pela própria companhia e não bastam, isoladamente, para estabelecer uma comparação definitiva entre produtos. A publicação também informou que Alan Cowen, ex-CEO da Hume AI e atual diretor de pesquisa científica do Google DeepMind, e Leland Rechis participaram do desenvolvimento do lançamento.
Uma avaliação independente da Artificial Analysis apresentou um cenário mais equilibrado. No ranking Provider Voice, o Gemini 3.8 Flash TTS ficou em segundo lugar, com Elo 1260 e intervalo de confiança de 95% de mais ou menos 17 pontos. O Flash-Lite apareceu na sexta posição, com Elo 1235 e intervalo de mais ou menos 16 pontos.
O Cartesia Sonic 3.6 liderou a lista, com 1.757 amostras e Elo 1273. Na sequência vieram o Gemini 3.8 Flash TTS, o Alibaba Qwen-Audio-3.0-TTS-Plus, com Elo 1259, e o Inworld Realtime TTS-2, com Elo 1245. O ElevenLabs v3 Conversational ficou em 12º lugar, com Elo 1196.
Modelo lidera teste de pronúncia
No Pronunciation Robustness Benchmark da Artificial Analysis, o Gemini 3.8 Flash TTS obteve 89,5% e ocupou a primeira posição. A geração anterior, Gemini 3.1 Flash TTS, havia registrado 88,2%.
A OrcaRouter destacou que a diferença entre o Gemini 3.8 Flash TTS e o Qwen-Audio-3.0-TTS-Plus foi de apenas um ponto de Elo: 1260 contra 1259. Considerando os intervalos de confiança, a empresa avaliou que os três primeiros colocados estão dentro de uma mesma faixa de desempenho.
Uso gratuito até o fim de 2026
Na modalidade padrão, os dois modelos poderão ser usados gratuitamente até 31 de dezembro de 2026. A partir de 1º de janeiro de 2027, o Gemini 3.8 Flash TTS custará US$ 1 por milhão de tokens de entrada, US$ 18 por milhão de tokens de áudio gerado e US$ 0,25 para armazenamento temporário de contexto. No Flash-Lite TTS, os valores serão de US$ 1 para entrada e US$ 12 para saída de áudio.
Nos planos Batch & Flex, o Flash TTS terá preços entre US$ 0,25 e US$ 0,50 para entrada e entre US$ 4,50 e US$ 9 para saída, sempre por milhão de tokens. No Flash-Lite, as faixas serão de US$ 0,25 a US$ 0,50 para entrada e de US$ 3 a US$ 6 para saída.
A categoria Priority também permanecerá gratuita até o fim de 2026. Depois disso, o Flash TTS custará US$ 1,80 por milhão de tokens de entrada e US$ 32,40 por milhão de tokens de saída. Para o Flash-Lite, os preços serão de US$ 1,80 e US$ 21,60, respectivamente.
Comentários
Postar um comentário