IA
OpenAI déploie GPT-Live, un nouveau mode vocal pour ChatGPT basé sur une architecture full-duplex qui permet d’écouter et de parler simultanément, réduisant les interruptions et rendant les échanges plus proches d’une conversation humaine.

Le mode vocal de ChatGPT devient plus fluide et naturel avec l’arrivée de GPT-Live, un modèle capable d’écouter et de répondre en temps réel. Cette architecture full-duplex, décrite par OpenAI comme telle, limite les coupures intempestives et rapproche le dialogue d’une interaction entre personnes.
GPT-Live marque une évolution par rapport à la première version du mode vocal lancée en 2023, qui reposait sur trois systèmes distincts : reconnaissance vocale, génération textuelle via un modèle linguistique, puis synthèse vocale. Une version avancée avait ensuite intégré un modèle multimodal pour améliorer rapidité et fluidité. Aujourd’hui, GPT-Live remplace ce système précédent comme option par défaut pour les échanges sonores.
Pendant que l’utilisateur parle, ChatGPT peut émettre des interjections vocales courtes telles que « mmh » ou « oui », reproduisant ainsi les réactions spontanées observées dans les conversations réelles. En arrière-plan, le modèle peut aussi solliciter des versions plus puissantes comme GPT-5.5 lorsque la question exige une analyse approfondie ou une recherche étendue, sans rompre le flux vocal.
Le mode vocal est accessible depuis l’application ChatGPT sur iPhone et Android, ainsi que via le navigateur web. Pour l’activer, il suffit de cliquer sur l’icône représentant une onde sonore, située à l’extrême droite de la zone de saisie. Lors de la première utilisation, l’application demande l’autorisation d’accéder au microphone. Une fois lancé, un cercle flottant animé apparaît à l’écran, indiquant que le système est prêt à capter la voix. Le mode reste actif même si l’utilisateur quitte l’application ou verrouille l’écran.
L’intelligence du modèle vocal est réglable en trois niveaux via l’icône des paramètres en haut de l’écran : « Instant », « Medium » et « High ». Le niveau « Instant » privilégie la rapidité des réponses et constitue le réglage par défaut. « Medium » accorde un peu plus de temps de traitement pour des réponses plus nuancées. « High » est destiné aux questions complexes, avec un délai de réflexion accru. Cette personnalisation n’est pas disponible dans la version GPT-Live-1 mini, réservée aux utilisateurs gratuits.
Les abonnés aux plans ChatGPT Pro, Plus et Go bénéficient du modèle complet GPT-Live-1. Les utilisateurs de la version gratuite, quant à eux, ont accès à GPT-Live-1 mini. Ce dernier remplace désormais Advanced Voice comme option standard pour les échanges vocaux.
GPT-Live atténue nettement la sensation de dialoguer avec une machine. Il permet d’interrompre ChatGPT à tout moment ou de reprendre la parole sans attendre la fin de sa réponse. Il est aussi moins prompt à couper l’utilisateur dès qu’un silence bref survient, ce qui facilite les échanges longs et dynamiques.
La réactivité accrue de GPT-Live en fait aussi un outil pertinent pour la traduction orale en temps réel. Pendant la conversation, un glissement vers le bas de l’écran affiche le texte correspondant aux paroles de l’utilisateur et de ChatGPT. Si le modèle juge qu’une réponse nécessite un support visuel, il peut générer un widget interactif à côté de la réponse vocale afin d’en clarifier le sens.
Par défaut, GPT-Live démarre en mode « Instant », optimisé pour les demandes quotidiennes où la vitesse prime. Toutefois, il peut déléguer en arrière-plan des requêtes exigeant plus de ressources à des modèles plus performants, sans altérer le déroulé vocal. Pour les sujets régulièrement complexes, passer aux niveaux « Medium » ou « High » augmente légèrement le temps de réponse — d’une à deux secondes — tout en conservant une impression globale de naturel.
GPT-Live ne prend pas en charge, pour l’heure, le partage d’écran ni le partage vidéo. En cas de préférence pour l’ancien système vocal, il est possible de revenir à Advanced Voice via les paramètres de ChatGPT, dans la section dédiée au mode vocal. Depuis ce même menu, on peut modifier la voix, choisir la langue et définir Voice Mode comme option par défaut au lancement de l’application.



