IA
Google lanzó oficialmente Gemini 3.5 Transcribe, su nuevo modelo especializado en conversión de voz a texto, con una tasa de error del 2,6 % en 85 lenguas y dialectos.

Google ha presentado formalmente Gemini 3.5 Transcribe, su más reciente modelo especializado en el procesamiento de señales de audio. El anuncio fue reportado por MarkTechPost y marca un avance significativo en la precisión de la transcripción automática del habla.
El modelo logró una tasa de error del 2,6 % al convertir voz en texto, evaluado en un conjunto de 85 lenguas y dialectos distintos. Su arquitectura neuronal permite identificar y separar múltiples voces simultáneas en un mismo entorno, además de filtrar eficazmente el ruido ambiental. Esta capacidad facilita la generación inmediata de transcripciones textuales de reuniones y llamadas telefónicas.
La compañía confirmó que Gemini 3.5 Transcribe está disponible para integración por parte de desarrolladores mediante sus APIs en la nube. Entre los usos previstos figuran herramientas de atención al cliente, plataformas de educación digital, así como sistemas automatizados para documentación médica y legal.
Google planea incorporar el modelo en sus servicios diarios con el objetivo de mejorar la experiencia del usuario. La iniciativa apunta a eliminar barreras lingüísticas y ofrecer recursos productivos avanzados, permitiendo a las organizaciones comunicarse con audiencias internacionales de forma fluida y profesional.



