El nuevo modelo de Google que ordena el caos: así funciona Gemini 3.5 Transcribe
¿Cansado de transcribir audios a mano? El nuevo Gemini 3.5 Transcribe promete ordenar el caos. Descubrí cómo funciona y en qué dispositivos ya está disponible.
Google presentó una versión mejorada de su inteligencia artificial que promete poner fin a las tediosas transcripciones manuales. El nuevo sistema, bautizado Gemini 3.5 Transcribe, no solo reconoce la voz con mayor precisión, sino que también es capaz de convertir discursos desordenados en textos coherentes.
La tecnológica estadounidense anunció esta semana el lanzamiento de un modelo de audio que, según aseguró en sus redes sociales, "mejora exponencialmente" el reconocimiento de voz. El anuncio llega en un momento en que las herramientas de IA ya habían revolucionado la forma de trabajar con audio, pero este nuevo avance marca un antes y un después.
¿Qué novedades trae Gemini 3.5 Transcribe?
El modelo detecta automáticamente más de 85 idiomas, incluyendo diferentes acentos y dialectos. Pero el gran salto respecto a sus antecesores es su habilidad para transformar el habla no estructurada en texto con formato coherente, algo que hasta ahora resultaba un desafío para los sistemas convencionales.
Según detalló Engadget, los usuarios podrán editar las transcripciones mediante comandos verbales. Además, el sistema elimina por su cuenta las palabras de relleno típicas de la oralidad, como los extensos "eeee" o las murmuraciones que suelen colarse en dictados o conversaciones.
Otra de las ventajas destacadas es su capacidad para atribuir la voz a hasta tres hablantes distintos, incluyendo marcas de tiempo. Esto resulta especialmente útil para transcribir reuniones, entrevistas o podcasts, donde intervienen múltiples personas. La compañía también asegura que el modelo puede captar el audio con claridad incluso en espacios ruidosos.
¿Dónde estará disponible la nueva versión?
Gemini 3.5 Transcribe ya se encuentra disponible en la aplicación del modelo para MacOS, aunque solo en inglés. En Android, llega a través de Rambler, una función de dictado con IA integrada en el teclado Gboard de Google, en regiones seleccionadas. También hay una vista previa para desarrolladores que quieran probar sus capacidades.
Este lanzamiento coincide con un momento de enorme crecimiento para Google en el campo de la inteligencia artificial. Recientemente, la compañía anunció que Gemini superó los 1.000 millones de usuarios activos al mes, convirtiéndose en uno de sus productos de mayor expansión. El CEO de Google, Sundar Pichai, celebró la cifra en su cuenta de X y destacó que se trata del decimocuarto servicio de la firma en alcanzar ese hito.
Con esta nueva herramienta, Google busca consolidar su liderazgo en el mercado de la IA aplicada a la productividad, ofreciendo soluciones que simplifican tareas cotidianas y que, hasta hace poco, requerían de un esfuerzo manual considerable.