IA
OpenAI lanza GPT-Live, un nuevo modo de voz para ChatGPT que permite interacción simultánea, respuestas contextuales como «mmh» o «sí», tres niveles ajustables de profundidad de respuesta y soporte nativo para traducción en tiempo real.

ChatGPT ahora conversa con mayor naturalidad gracias a GPT-Live, su nuevo modelo de voz desarrollado por OpenAI. Este sistema opera bajo una arquitectura Full-Duplex, lo que le permite escuchar y hablar al mismo tiempo, reduciendo las interrupciones innecesarias y acercando la experiencia a una conversación humana real.
La primera versión de Voice Mode, lanzada en 2023, dependía de tres sistemas independientes: uno para convertir el habla del usuario en texto, otro para generar la respuesta mediante un modelo lingüístico y un tercero para sintetizar esa respuesta en voz. Posteriormente, OpenAI introdujo Advanced Voice Mode, basado en un modelo multimodal para mejorar velocidad y fluidez. Ahora, GPT-Live sustituye completamente a ese sistema anterior como opción predeterminada para las conversaciones auditivas.
GPT-Live puede emitir respuestas vocales breves mientras el usuario sigue hablando, como «mmh» o «sí», imitando los gestos verbales típicos de las conversaciones espontáneas. Además, cuando una consulta requiere mayor procesamiento, el modelo puede derivar en segundo plano tareas complejas a modelos más avanzados —como GPT-5.5— sin interrumpir el flujo sonoro ni forzar pausas perceptibles.
GPT-Live está disponible en la aplicación móvil de ChatGPT para iPhone y Android, así como en la versión web. Para iniciar una conversación, basta con pulsar el ícono de onda sonora ubicado en el extremo derecho del cuadro de escritura. Si es la primera vez que se usa esta función, el sistema solicitará permiso para acceder al micrófono del dispositivo. Una vez activado, aparece una esfera flotante animada en pantalla, y el usuario puede comenzar a hablar de forma natural. El modo permanece activo incluso al cambiar a otra aplicación o bloquear la pantalla del teléfono.
Desde el menú de configuración —accesible mediante el ícono de ajustes en la parte superior de la interfaz— los usuarios pueden seleccionar entre tres niveles de capacidad de procesamiento para el modelo de voz:
Instant: responde con máxima rapidez; es el nivel predeterminado.
Medium: otorga un margen adicional de reflexión para ofrecer respuestas más elaboradas.
High: destinado a consultas complejas, asigna mayor tiempo de cómputo al modelo para análisis profundos.
Esta personalización no está disponible en la variante GPT-Live-1 mini, por lo que únicamente corresponde a los planes de suscripción pagados.
Los usuarios de ChatGPT Pro, Plus y Go tienen acceso completo a GPT-Live-1. En cambio, los usuarios gratuitos utilizan exclusivamente GPT-Live-1 mini. El nuevo modelo reemplaza a Advanced Voice como opción automática en todas las cuentas compatibles.
Una de las características centrales de GPT-Live es su capacidad para disminuir la sensación de estar interactuando con una máquina. Ya no es necesario esperar a que finalice la respuesta para intervenir: el usuario puede interrumpir, reformular o continuar hablando sin que el sistema interprete una pausa breve como el fin de su intervención. Esto favorece especialmente las conversaciones extensas y dinámicas.
La baja latencia de GPT-Live lo convierte en una herramienta viable para traducción simultánea durante diálogos en vivo. Durante la conversación, deslizando hacia abajo en la pantalla se muestra el texto transcrito tanto de lo dicho por el usuario como de las respuestas de ChatGPT. Asimismo, si el sistema detecta que una pregunta requiere apoyo visual, puede generar automáticamente un widget interactivo junto a la respuesta vocal para facilitar su comprensión.
GPT-Live inicia por defecto en el nivel Instant, optimizado para preguntas cotidianas donde prima la velocidad. No obstante, traslada de forma transparente tareas de mayor exigencia a modelos especializados en segundo plano, manteniendo la continuidad auditiva. Para quienes usan Voice Mode con frecuencia en temas técnicos o abstractos, los niveles Medium y High ofrecen mayor tiempo de procesamiento, con un aumento de uno o dos segundos en la latencia, sin comprometer la sensación general de naturalidad.
A pesar de sus avances, GPT-Live no soporta actualmente funciones como compartir pantalla o transmitir video. Quienes prefieran el sistema anterior pueden revertir a Advanced Voice desde la sección de configuración de ChatGPT, accediendo a Voice y seleccionando un modelo distinto. Desde ese mismo menú también es posible cambiar la voz del asistente, elegir el idioma preferido y configurar Voice Mode como modo predeterminado al abrir la aplicación.



