ИИ
OpenAI представила GPT-Live — голосовой режим ChatGPT, основанный на полнодуплексной архитектуре, позволяющей одновременно слушать и говорить, с поддержкой промежуточных реплик, адаптивного уровня интеллекта и фонового переключения на более мощные модели.

OpenAI внедрила в ChatGPT новый голосовой режим под названием GPT-Live, построенный на принципе Full-Duplex. Это означает, что модель способна одновременно воспринимать речь пользователя и генерировать устный ответ, снижая количество преждевременных прерываний и приближая диалог к естественному разговору между людьми.
Первая версия Voice Mode, выпущенная OpenAI в 2023 году, использовала три отдельные системы: преобразование речи в текст, генерацию ответа языковой моделью и синтез речи из текста. Позднее компания представила Advanced Voice Mode на базе мультимодальной архитектуры для повышения скорости и естественности. GPT-Live заменил Advanced Voice в качестве стандартного голосового режима.
Одной из ключевых особенностей GPT-Live является способность выдавать короткие устные реакции во время речи пользователя — например, «ммм» или «ага», имитируя поведение человека в живом диалоге. При необходимости модель может в фоновом режиме делегировать выполнение запроса более мощным системам, включая GPT-5.5, не прерывая голосовое взаимодействие.
GPT-Live доступен в мобильном приложении ChatGPT для устройств на iOS и Android, а также через веб-браузер. Для начала голосового диалога требуется нажать на значок волны звука, расположенный в крайнем правом углу поля ввода. При первом использовании система запрашивает разрешение на доступ к микрофону. После активации появляется плавающий анимированный круг, и пользователь может начать говорить естественным образом. Голосовой режим остаётся активным даже при переключении на другие приложения или блокировке экрана.
Пользователи могут регулировать уровень интеллектуальной глубины обработки через значок настроек в верхней части интерфейса. Доступны три варианта: Instant — режим быстрых ответов по умолчанию; Medium — с небольшим увеличением времени на размышление и более развёрнутыми ответами; High — для сложных тем, с расширенным временем обработки. Эта функция недоступна в версии GPT-Live-1 mini и реализована только в платных тарифах.
Пользователи ChatGPT Pro, Plus и Go получают доступ к полной версии GPT-Live-1. Бесплатные аккаунты ограничены GPT-Live-1 mini. GPT-Live стал новым стандартом голосового взаимодействия, полностью заменив предыдущий Advanced Voice.
GPT-Live снижает ощущение общения с автоматизированной системой: пользователь может прерывать модель или продолжать речь без ожидания завершения ответа. Модель реже ошибочно интерпретирует краткую паузу как окончание фразы. Это особенно важно для длительных диалогов. Высокая скорость реакции делает GPT-Live подходящим инструментом для синхронного перевода. Во время разговора можно прокрутить экран вниз, чтобы увидеть текстовую расшифровку реплик пользователя и ChatGPT. При необходимости модель может генерировать интерактивный виджет рядом с голосовым ответом, если вопрос требует визуального пояснения.
На текущем этапе GPT-Live не поддерживает совместное использование экрана или видеопотока. При неудовлетворённости новым режимом пользователь может вернуться к предыдущей голосовой модели через раздел настроек ChatGPT → Voice → выбор альтернативного варианта. Там же доступны параметры изменения голоса, выбор языка и установка Voice Mode в качестве режима по умолчанию при запуске приложения.



