
Última atualização: 16 de setembro de 2026.
A Google lançou a 15 de setembro de 2026 dois novos modelos de áudio: o Gemini 3.8 Live e o Gemini 3.8 Live Extended Thinking, ambos pensados para programadores construírem agentes de voz em tempo real. No anúncio oficial no blog da Google, a empresa apresenta-os como modelos capazes de raciocinar e executar tarefas em segundo plano sem quebrar o fluxo da conversa, algo que os modelos de voz anteriores tinham dificuldade em fazer bem. Segundo dados citados por vários meios especializados, a variante Extended Thinking alcançou 82,6 pontos no índice de qualidade Speech-to-Speech da Artificial Analysis, o valor mais alto já registado nesse ranking.
O que trazem de novo
- Execução de funções em segundo plano enquanto o áudio continua a ser transmitido, sem pausas percetíveis na conversa
- Contexto visual integrado na conversa de voz, permitindo ao agente reagir ao que “vê” e não só ao que ouve
- Tratamento preciso de dados alfanuméricos, como códigos de confirmação, algo em que os modelos de voz tradicionalmente falhavam
- Suporte a mais de 97 idiomas, com consistência de sotaque entre respostas
- Raciocínio configurável em segundo plano na variante Extended Thinking, pensado para problemas complexos e de vários passos
A Google afirma ainda que os dois modelos superam o GPT Live 1 Astra, da OpenAI, e o Grok Voice Think Fast 2.0, da xAI, tanto em qualidade como em custo. Vale a pena tratar esta comparação com a reserva habitual: vem da própria Google, num anúncio de lançamento, e ainda não foi replicada por um benchmark independente que tenhamos conseguido confirmar. Para o panorama mais amplo de como os modelos de topo se comparam este mês, vale a pena rever o artigo sobre os benchmarks de IA mais seguidos em 2026.
Preço
Segundo o anúncio oficial, os dois modelos custam:
- 0,005 USD por minuto de áudio de entrada
- 0,018 USD por minuto de áudio de saída
Alguns agregadores do setor, como o gekro, traduziram isto para uma estimativa de cerca de 1,38 USD por hora de utilização típica em duas direções. É uma estimativa de terceiros, não um valor oficial da Google, e o custo real varia com a proporção real entre áudio de entrada e de saída em cada aplicação.
Onde experimentar
O Gemini 3.8 Live e a variante Extended Thinking já estão disponíveis via Gemini API e Google AI Studio, com acesso empresarial também através do Vertex AI. A Google lista ainda integração já pronta com parceiros de desenvolvimento como Pipecat, LiveKit, LangChain, Agora, Fishjam, Vercel e Vision Agents, o que reduz o trabalho de quem já usa algum destes frameworks para construir agentes de voz.
Para quem serve
É importante ser direto sobre isto: o Gemini 3.8 Live não é uma funcionalidade que apareça na app de consumo do Gemini para experimentares diretamente. É um modelo de API, dirigido a programadores que constroem agentes de voz, como assistentes de atendimento ao cliente, agentes telefónicos ou apps com interação por voz em tempo real. Se não programas, o impacto só chega até ti mais tarde, através de produtos de terceiros construídos com este modelo. Para veres onde este modelo encaixa no conjunto mais amplo dos serviços de IA da Google, consulta o nosso guia sobre todos os serviços de IA da Google em 2026.
Perguntas Frequentes
Qual a diferença entre o Gemini 3.8 Live e o Extended Thinking?
A variante Extended Thinking acrescenta raciocínio configurável em segundo plano, pensado para tarefas mais complexas e de vários passos, mantendo a resposta de voz fluida.
É verdade que bate o GPT-6 Astra na conversação por voz?
Não exatamente. A comparação da Google é com o GPT Live 1 Astra, o produto de voz da OpenAI, não com o modelo de texto GPT-6 Astra que cobrimos noutro artigo. São produtos diferentes dentro da mesma família de lançamentos da OpenAI.
O Gemini 3.8 Live suporta português?
A Google refere suporte a mais de 97 idiomas com consistência de sotaque, o que deverá cobrir o português, mas não encontrámos uma lista oficial com os idiomas nomeados um a um.
Preciso de saber programar para usar isto?
Sim. Ao contrário de um chatbot, este é um modelo de API que precisa de ser integrado numa aplicação para ser usado.
Para acompanhar a família Gemini mais próxima do consumidor final, vale a pena rever também o artigo sobre o Gemini 3.7 Flash, o modelo Flash mais recente focado em coding e agentes de texto.