أوبن إي آي تُطلق ثلاثة نماذج صوتية متطورة في واجهتها البرمجية الفورية
أطلقت أوبن إي آي نماذج GPT-Realtime-2 وTranslate وWhisper ضمن واجهتها البرمجية الفورية، لتنقل الصوت من الردود البسيطة إلى محادثات تستدل وتترجم وتُدوّن في الوقت الحقيقي.

في السابع من مايو 2026، أعلنت شركة أوبن إي آي عن إطلاق ثلاثة نماذج صوتية متطورة ضمن واجهتها البرمجية الفورية، في خطوة تُعيد رسم ملامح التفاعل الصوتي بين الإنسان والذكاء الاصطناعي. تأتي هذه النماذج لتُوسّع حدود ما يمكن للتطبيقات الصوتية إنجازه، منتقلةً بها من الردود الآلية البسيطة إلى محادثات فعلية قادرة على التفكير والتصرف.
النموذج الأول: قدرات GPT-5 في صوت حقيقي
أول هذه النماذج هو GPT-Realtime-2، وهو نموذج صوتي يحمل قدرات الاستدلال ذاتها الموجودة في جيل GPT-5. ما يميّزه جوهرياً هو قدرته على متابعة سياق المحادثة الممتدة وفهم الطلبات المعقدة والتصرف بناءً عليها في الوقت ذاته، بدلاً من الاكتفاء بالإجابة على الأسئلة المنعزلة. تُسعَّر هذه الخدمة بحسب الرموز المميزة بواقع 32 دولاراً لكل مليون رمز صوتي مدخلاً، و64 دولاراً لكل مليون رمز مخرجاً.
النموذج الثاني: ترجمة فورية لسبعين لغة
أما النموذج الثاني فهو GPT-Realtime-Translate، المخصص للترجمة الفورية، الذي يدعم أكثر من سبعين لغة كمدخلات وثلاث عشرة لغة كمخرجات. يُحافظ النموذج على وتيرة الحديث الطبيعية دون انقطاع أو تأخر، مما يجعله أداةً واعدة للمؤتمرات الدولية والتطبيقات التعليمية متعددة اللغات وخدمات الترجمة الاحترافية. يُسعَّر بالدقيقة بمعدل 0.034 دولار لكل دقيقة، وهو نظام يُتيح للمطورين التحكم في التكاليف بحسب حجم الاستخدام.
النموذج الثالث: تحويل الكلام إلى نص في لحظته
والثالث هو GPT-Realtime-Whisper، نموذج تحويل الكلام إلى نص في الوقت الفعلي، الذي ينتج نصاً مكتوباً بالتزامن مع المحادثة الجارية. تنفتح أمامه تطبيقات التوثيق التلقائي وإمكانية الوصول للأشخاص ذوي الإعاقة السمعية والصحافة والمقابلات والاجتماعات المؤسسية. سعره 0.017 دولار لكل دقيقة.
تحوّل فلسفي في الواجهات الصوتية
وصفت أوبن إي آي هذه النماذج مجتمعةً بأنها تنقل الصوت الفوري من نمط الأوامر والردود البسيطة إلى واجهات تستطيع فعلاً إنجاز الأعمال: تستمع وتستدل وتترجم وتُدوّن وتتخذ الإجراء أثناء انكشاف المحادثة. هذه الصياغة تُلخّص التحول الفلسفي الذي تسعى إليه الشركة، الانتقال من الأداة التفاعلية إلى الشريك الحواري الفاعل.
تطبيقات عملية في قطاعات متعددة
تتمحور الاستخدامات الأولية المُعلن عنها حول خدمة العملاء الصوتية، إذ يمكن توظيف هذه النماذج لتقديم دعم صوتي آلي يتجاوز حدود قوائم الخيارات المسجلة التقليدية. غير أن أوبن إي آي تُشير إلى إمكانيات أوسع تشمل التعليم والإعلام والفعاليات ومنصات المحتوى الإبداعي.
على الصعيد التعليمي، يمكن بناء أنظمة تُقدّم شروحاً صوتية بلغات متعددة في آنٍ واحد، أو أدوات لتدريب المتحدثين العامة وتحليل الأداء الشفهي. وفي مجال الإعلام، يمكن أتمتة تفريغ المقابلات والترجمة الفورية للبث المباشر.
ضمانات أمنية مُدمجة
لم تُهمل أوبن إي آي الجانب الأمني في هذا الإطلاق؛ إذ أعلنت عن ضمانات تقنية مُدمجة تُراقب المحتوى وتوقف المحادثات التي تنتهك سياسات الاستخدام المقبول. يُعالج هذا الإجراء المخاوف المتعلقة بتوظيف هذه الأدوات في الحملات الصوتية الآلية أو عمليات الاحتيال الهاتفي المنتشرة.
المشهد التنافسي
يأتي هذا الإطلاق في سياق منافسة محتدمة بين كبرى شركات الذكاء الاصطناعي للاستحواذ على سوق الواجهات الصوتية. مع تقلص الهوة التقنية بين الأنظمة الآلية والمحاورين البشريين، تتعالى التوقعات بأن تُحدث هذه الأدوات نقلة نوعية في كيفية إدارة الشركات لتواصلها مع عملائها، وكيفية تعامل الأفراد مع المعلومات والخدمات الرقمية يومياً.
تتوفر النماذج الثلاثة الجديدة حالياً للمطورين المسجلين لدى أوبن إي آي عبر واجهة البرمجة الفورية، ويمكن اختبارها أيضاً في بيئة التجريب التفاعلية على منصة الشركة.
المزيد من ذكاء اصطناعي

الهند تأمر بإزالة تطبيق بيت تشات اللامركزي من متاجر التطبيقات
أمرت السلطات الهندية بإزالة تطبيق بيت تشات لجاك دورسي القائم على شبكة بلوتوث لامركزية، وسط جدل قانوني حول حرية الإنترنت وصلاحيات الرقابة الحكومية.

شون باركر يعيد بناء Stability AI حول صناعة الموسيقى بدعم سوني ووارنر
يقود مؤسس نابستر السابق تحولاً استراتيجياً لشركة Stability AI نحو أدوات ذكاء اصطناعي موسيقية، بتمويل جديد وشراكة مع كبرى شركات التسجيلات العالمية.

استقالة مسؤول سلامة في OpenAI وسط اتهامات بانهيار ثقافة السلامة
استقال ديفيد روبنسون من فريق سلامة OpenAI متهماً الشركة بثقافة مؤسسية مهتزة غير مؤهلة لتطوير ذكاء اصطناعي متقدم بأمان، وسط حادثة اختراق Hugging Face.

لا تنخدعوا: النماذج اللغوية الكبيرة لا تفكر فعلاً كما تبدو
يرى باحث في الذكاء الاصطناعي أن النماذج اللغوية الكبيرة تنجح بفضل التنبؤ السريع بالأنماط لا الاستدلال المنهجي الحقيقي، مستشهداً بحركة ألفاغو الأسطورية رقم 37 كمثال على الاستدلال الفعلي الذي تفتقر إليه هذه النماذج.

آبل تشدد ضوابط الوصول الكامل للقرص في ماك مواجهةً لمخاطر وكلاء الذكاء الاصطناعي
أعلنت آبل تشديد صلاحية الوصول الكامل للقرص في نظام ماك أو إس، بعد تنامي المخاوف من وكلاء الذكاء الاصطناعي القادرين على الوصول غير المقيّد إلى ملفات المستخدمين ورسائلهم وسجل تصفحهم.

معالج ضوئي يكتشف التزييف العميق في الفيديو بدقة تقارب 98%
باحثون في جامعة كاليفورنيا لوس أنجلوس يطورون معالجاً عصبياً ضوئياً يفحص عشرات مقاطع الفيديو في آنٍ واحد باستخدام الضوء بدلاً من الكهرباء، لكشف التزييف العميق بدقة واستهلاك طاقة منخفضين.