⌨️​ Google presenta Gemini 3.5 Transcribe, su modelo de voz a texto más eficaz

Google ha presentado Gemini 3.5 Transcribe, la última actualización de su modelo de voz a texto dentro de la familia Gemini. La compañía lo presenta como su sistema de transcripción más preciso hasta la fecha, con mejoras notables para lidiar con el ruido de fondo y la jerga técnica, un salto que muchos de nosotros notaremos en cuanto dictemos una nota de voz o un mensaje desde el móvil.

El nuevo modelo llega con funciones que antes exigían revisión manual: corrige errores sobre la marcha, elimina muletillas del habla y da formato al texto de forma automática, sin que tengamos que intervenir nosotros mismos. También puede repartir tareas más complejas, como analizar archivos o generar imágenes, apoyándose en otros modelos de la familia Gemini para completar el trabajo sin salir de la misma herramienta.

Una tasa de error que baja al 2,6 % en transcripciones grabadas

Google cifra el rendimiento de Gemini 3.5 Transcribe con una métrica concreta: la tasa de error de palabras (WER) se queda en el 4,0 % de media para la transcripción en streaming y cae hasta el 2,6 % cuando el audio ya está grabado. Esa precisión permite leer con fiabilidad datos alfanuméricos como números de pedido o códigos postales, elementos que antes solían quedar mal transcritos y que muchos de nosotros hemos tenido que corregir a mano tras cada dictado.

La compañía atribuye parte de la mejora a cómo interpreta el modelo el habla natural, no solo el sonido en bruto. Reconoce vocabulario personalizado y términos especializados, lo que reduce las correcciones sobre nombres propios o conceptos técnicos que antes había que deletrear o repasar tras cada sesión de dictado. «Gemini 3.5 Transcribe está diseñado para captar tu estilo natural de habla y entender mejor tu intención, además de reconocer vocabulario personalizado, de forma que puedas ejecutar tareas con la voz», explicó Google en la publicación con la que presentó el modelo.

Ochenta y cinco idiomas y hasta tres voces distintas

El modelo funciona en 85 idiomas y reconoce acentos regionales y variantes dialectales dentro de cada uno de ellos, lo que amplía su margen de acierto en conversaciones donde conviven distintas formas de hablar la misma lengua. En archivos de audio ya grabados, además, puede diferenciar hasta tres interlocutores distintos y marcar con precisión el momento exacto en que interviene cada uno, generando marcas de tiempo automáticas para cada intervención.

 

Esa función resulta útil para actas de reuniones, entrevistas o análisis posteriores a llamadas de atención al cliente, donde saber quién habló y en qué momento ahorra buena parte del trabajo de edición manual que antes recaía en quien transcribía el audio a mano. Combinada con el reconocimiento de vocabulario personalizado, la herramienta permite trabajar con grabaciones que mezclan varios acentos y terminología específica sin perder la atribución de cada voz. Para quienes trabajamos habitualmente con grabaciones largas, en reuniones con participantes de varios países o con acentos distintos, esta combinación de idiomas, dialectos y separación de voces marca una diferencia real frente a las herramientas que hemos usado hasta ahora, que solían perder precisión en cuanto aparecía más de un acento en la misma grabación.

Disponible ya para desarrolladores; llegará a Chrome

Los desarrolladores pueden probar Gemini 3.5 Transcribe en vista previa pública a través de la API de Gemini, disponible en Google AI Studio y Google Vertex AI. Con ella pueden construir agentes de voz conversacionales, sistemas de subtitulado en tiempo real para retransmisiones o eventos en directo, y herramientas de análisis posterior a llamadas que antes requerían servicios de transcripción externos.

Nosotros, como usuarios de a pie, ya podemos notar este cambio en dos puntos que seguro que muchos utilizáis a diario: la aplicación Gemini para macOS y el dictado por voz de Gboard en Android incorporan el nuevo modelo, según ha confirmado Google. La compañía ha anunciado también que el modelo llegará próximamente a Google Chrome, donde podremos dictar texto en cualquier campo web sin necesidad de teclado, una función ideal para cuando queramos rellenar formularios o buscar información en la red sin tener que teclear de manera constante.

Autor

Deja un comentario

Tu dirección de correo electrónico no será publicada. Los campos obligatorios están marcados con *