Novo modelo do Google combina reconhecimento de voz, compreensão de contexto e formatação automática para tornar o uso da voz mais natural em celulares, computadores e aplicações de IA. O post Google lança Gemini 3.5 Transcribe, IA que entende o que você quis…

PRINCIPAIS DESTAQUES

🎙️ Transcrição mais inteligente: o Gemini 3.5 Transcribe não se limita a transformar voz em texto. Ele remove vícios de linguagem, resolve autocorreções e organiza o conteúdo para deixá-lo mais natural.

⚡ Mais velocidade e precisão: segundo dados divulgados pelo Google, o modelo reduz em 70% o tempo até a transcrição final em comparação com o Chirp 3. Em testes da Artificial Analysis, registra WER de 4,0% em streaming e 2,6% em processamento sem streaming.

🌎 Mais de 85 idiomas: a tecnologia reconhece idiomas automaticamente, entende mudanças de idioma durante uma conversa e pode identificar diferentes participantes em arquivos de áudio gravados.

O Google acaba de apresentar o Gemini 3.5 Transcribe, um novo modelo de inteligência artificial desenvolvido para transformar fala em texto de uma maneira muito mais próxima da comunicação humana.

A diferença parece pequena à primeira vista, mas muda bastante a experiência. Em vez de simplesmente registrar cada palavra pronunciada, o sistema consegue interpretar o contexto da fala e entregar um texto mais organizado, com pontuação, estrutura e correções aplicadas automaticamente.

É uma mudança importante porque a fala humana raramente acontece de maneira perfeitamente organizada.

O Gemini 3.5 Transcribe foi criado justamente para lidar com esse problema.

Imagine alguém dizendo:

Uma transcrição convencional poderia registrar toda a frase, incluindo a correção. O novo modelo do Google consegue interpretar que a informação final é quarta-feira às duas e organizar o texto de acordo com essa intenção.

O mesmo vale para vícios de linguagem, repetições, hesitações e falsos começos.

No modo de transcrição inteligente, a tecnologia pode remover essas interrupções e aplicar automaticamente pontuação, capitalização e uma estrutura mais adequada ao conteúdo. O resultado deixa de parecer uma transcrição bruta e passa a se aproximar de um texto pronto para leitura.

Isso não significa, porém, que o modelo obrigatoriamente altere todo áudio. A documentação do Google também oferece um modo verbatim, destinado justamente a quem precisa de uma transcrição palavra por palavra, preservando repetições, vícios de linguagem e falsos começos.

Essa distinção é especialmente importante para jornalistas, pesquisadores, equipes jurídicas e profissionais que precisam preservar exatamente o que foi dito.

A velocidade é outro dos pontos centrais do lançamento.

O Gemini 3.5 Transcribe foi desenvolvido para funcionar tanto em situações de conversação em tempo real quanto no processamento de arquivos gravados. Para isso, o Google disponibilizou duas experiências diferentes para desenvolvedores.

Pensada para aplicações interativas, oferece transmissão contínua e bidirecional com latência inferior a um segundo. O modelo específico é identificado como gemini-3.5-transcribe-live.

Voltada para arquivos de áudio previamente gravados, permite recursos como identificação de participantes e marcações de tempo por palavra. O modelo utilizado nesse caso é o gemini-3.5-transcribe.

O avanço de velocidade em relação ao Chirp 3 também chama atenção. De acordo com o Google, o tempo até a transcrição final melhorou em 70%.

Os números oficiais mostram que a proposta do Google não é apenas produzir uma transcrição mais limpa. A empresa também quer disputar espaço no mercado de APIs de voz, oferecendo aos desenvolvedores uma alternativa para construir assistentes, ferramentas de atendimento, legendas e sistemas de análise de chamadas.