الذكاء الإصطناعي
أطلقت OpenAI نموذج GPT-Live الجديد لوضع الصوت في ChatGPT، الذي يعتمد على بنية Full-Duplex ويتيح الاستماع والتحدث في الوقت نفسه، مع ثلاثة مستويات تفاعلية متاحة للمستخدمين المدفوعين.

يُفعّل نموذج GPT-Live حاليًا وضع المحادثة الصوتية في تطبيق ChatGPT عبر أجهزة iPhone وAndroid ومتصفح الويب، ليحل محل Advanced Voice Mode السابق كخيار افتراضي للدردشة الصوتية. وتستند هذه الترقية إلى ما تصفه OpenAI ببنية Full-Duplex، التي تسمح للنموذج بالاستماع والتحدث في وقت واحد دون انقطاع.
في النسخة الأولى من Voice Mode التي أطلقتها OpenAI عام ٢٠٢٣، اعتمدت المحادثة الصوتية على ثلاث أنظمة مستقلة: نظام لتحويل كلام المستخدم إلى نص، ونظام آخر لتوليد الرد باستخدام نموذج لغوي، وثالث لتحويل الإجابة إلى صوت. ثم قدّمت الشركة لاحقًا Advanced Voice Mode باستخدام نموذج متعدد الوسائط لتحسين السرعة والطبيعية. أما الآن، فقد استُبدلت تلك البنية بـ GPT-Live كنموذج مركزي متكامل لإدارة المحادثات الصوتية.
من أبرز الخصائص الجديدة قدرة ChatGPT على إصدار ردود صوتية قصيرة أثناء حديث المستخدم، مثل «ممم» أو «أجل»، على غرار التفاعل البشري الطبيعي. كما يمكن لـ GPT-Live، عند الحاجة إلى تفكير أعمق أو بحث موسع، الاستعانة في الخلفية بنماذج أكثر قدرة مثل GPT-5.5، مع الحفاظ على استمرارية المحادثة الصوتية دون انقطاع ملحوظ.
لبدء المحادثة الصوتية، يُضغط على أيقونة الموجة الصوتية الظاهرة في أقصى يمين مربع الكتابة. وفي أول استخدام، يطلب التطبيق إذنًا لتشغيل ميكروفون الجهاز. وبمجرد الدخول إلى وضع الصوت، تظهر دائرة عائمة متحركة على الشاشة، ويمكن البدء بالحديث بشكل طبيعي. ويظل الوضع نشطًا حتى عند الانتقال إلى تطبيق آخر أو قفل شاشة الهاتف.
يمكن تغيير مستوى ذكاء نموذج الصوت عبر الضغط على أيقونة الإعدادات أعلى الشاشة، حيث تتوفر ثلاثة خيارات:
وهذه الميزة غير متاحة حاليًا في نسخة GPT-Live-1 mini، وبالتالي تقتصر على خطط ChatGPT Pro وPlus وGo.
يحصل مشتركو خطط ChatGPT Pro وPlus وGo على نموذج GPT-Live-1، بينما يقتصر مستخدمو الخطة المجانية على نسخة GPT-Live-1 mini. ويُطبّق هذا التوزيع تلقائيًا دون حاجة إلى تفعيل يدوي، مع جعل GPT-Live الخيار الافتراضي لجميع المحادثات الصوتية الجديدة.
يقلل GPT-Live من الإحساس بالتحدث مع نظام آلي، إذ لا يتعين على المستخدم الانتظار حتى ينتهي ChatGPT من الرد قبل أن يبدأ الحديث من جديد. بل يمكنه مقاطعة النموذج أو مواصلة الحديث بصورة سلسة، كما أصبح أقل ميلًا لاعتبار التوقف القصير أثناء الكلام نهاية للجملة والانطلاق في الرد مبكرًا.
تتيح سرعة استجابة GPT-Live استخدامه كأداة للترجمة أثناء المحادثات المباشرة. وخلال الحوار، يمكن التمرير لأسفل لعرض النص المكتوب لكل ما يقوله كل من المستخدم وChatGPT. وإذا رأى النموذج أن السؤال يتطلب عنصرًا بصريًّا، فإنه ينشئ تلقائيًّا عنصرًا تفاعليًّا (Widget) بجانب الرد الصوتي لدعم فهم الإجابة.
لا يدعم GPT-Live حاليًا مشاركة الشاشة أو مشاركة الفيديو. كما يمكن للمستخدم العودة إلى نموذج الصوت السابق من خلال إعدادات ChatGPT، ثم الدخول إلى قسم Voice واختيار نموذج مختلف. ومن نفس القسم، يُمكن تغيير صوت ChatGPT، وتحديد اللغة، وجعل Voice Mode هو الوضع الافتراضي عند تشغيل التطبيق.



