ChatGPT تُطلق نموذج Images 2.0 لتوليد صور بدقة نصية غير مسبوقة

أعلنت OpenAI عن نموذجها الجديد ChatGPT Images 2.0 الذي يُحقق قفزة نوعية في عرض النصوص داخل الصور المولّدة بالذكاء الاصطناعي، بدقة تصل إلى 2K ودعم اللغات غير اللاتينية بما فيها العربية.

تحرير
ألمعي · هيئة التحرير
النشر
٢١ أبريل ٢٠٢٦
المصدر
TechCrunch ↗
القراءات
٩
الوقت
قراءة 3 دقائق
شعار OpenAI الحلزوني الملوّن على خلفية داكنة

أعلنت شركة OpenAI يوم الثلاثاء عن إطلاق نموذجها الجديد ChatGPT Images 2.0، وهو أحدث جيل من نماذج توليد الصور القائمة على الذكاء الاصطناعي، مُمثّلاً قفزة نوعية في قدرة الأنظمة الذكية على تحويل الأوصاف النصية إلى صور بدقة احترافية، لا سيما في مجال عرض النصوص المكتوبة داخل الصور المُولَّدة.

طوال السنوات الماضية، ظلّ دمج النص المكتوب ضمن الصور المولّدة بالذكاء الاصطناعي تحدياً عصياً. فقد دأبت النماذج السابقة على تشويه الحروف وتحريف الكلمات بشكل يُفسد الاستخدامات الاحترافية؛ فقد كانت قائمة طعام افتراضية تخرج بأسماء أصناف مشوّهة من قبيل enchuite وchuriros وburrto، وهو ما يعكس محدودية حقيقية في قدرة هذه النماذج على معالجة النص. أما اليوم، فيبدو أن نموذج Images 2.0 قد تجاوز هذا العائق تجاوزاً حقيقياً.

يتميز النموذج الجديد بجملة من القدرات التقنية المتقدمة، أبرزها دمج ما أطلقت عليه الشركة قدرات التفكير، وهي ميزة تُمكّن النموذج من البحث في الويب وتوليد صور متعددة من مطالبة نصية واحدة، فضلاً عن التحقق من صحة مخرجاته قبل تسليمها للمستخدم. ويدعم النموذج دقة وضوح تصل إلى 2K، كما يُجيد عرض النصوص بلغات غير لاتينية تشمل اليابانية والكورية والهندية والبنغالية.

وصفت OpenAI نموذجها الجديد بأنه يُقدّم مستوى غير مسبوق من الخصوصية والدقة في توليد الصور، قادراً على تجسيد النصوص الصغيرة وعناصر واجهة المستخدم والتراكيب الصورية المكثفة التي طالما أربكت النماذج السابقة. وتكفي مقارنة بسيطة بين مخرجات DALL-E 3 في عام 2024 ومخرجات Images 2.0 اليوم للتيقّن من حجم التقدم المحقق في هذا المجال.

تمتد إمكانات النموذج الجديد لتشمل إنشاء مواد تسويقية بأشكال ومقاسات مختلفة، وتصميم قصص مصوّرة متعددة اللوحات، وإنتاج رسوم بيانية ومخططات تفاعلية يمكن استخدامها مباشرة في العروض التقديمية والمنشورات الرقمية. غير أن توليد الصور المعقدة قد يستغرق عدة دقائق نظراً للثقل الحسابي الذي تستلزمه العمليات المعتمدة على التفكير والتحقق.

يعمل النموذج في وضعين متمايزين: الوضع الفوري المتاح لجميع المستخدمين بما فيهم أصحاب الحسابات المجانية، والوضع التفكيري المخصص للمشتركين في الخطط المدفوعة الذين يحتاجون إلى مخرجات أكثر تعقيداً ودقة. أما المطوّرون، فقد صار بإمكانهم الوصول إلى واجهة برمجة التطبيقات تحت المُعرِّف gpt-image-2 بتسعير يعتمد على حجم المخرجات، إذ تبلغ تكلفة الرموز المرئية المُدخلة 8 دولارات لكل مليون رمز، فيما تبلغ تكلفة المخرجات المولّدة 30 دولاراً لكل مليون رمز.

يطرح هذا الإصدار تساؤلات جوهرية حول مستقبل صناعات التصميم الجرافيكي والإعلام الرقمي والتسويق. فإذا كانت نماذج الجيل الأول قد قدّمت نفسها أدوات مساعدة تعمل بجانب المصمّم البشري، فإن نموذج Images 2.0 يُلمّح إلى عتبة جديدة تصير فيها جودة المخرجات كافية للاستخدام التجاري المباشر في كثير من السياقات دون الحاجة إلى تدخل متخصص.

يأتي هذا الإعلان في سياق منافسة حادة في سوق توليد الصور، إذ تتنافس شركات كـ Midjourney وStability AI وAdobe Firefly على الحصص نفسها. ويبدو أن OpenAI تستثمر تكاملها العضوي مع ChatGPT لتقديم تجربة أكثر سلاسة للمستخدم النهائي، بدلاً من إلزامه بتعلم واجهات مستقلة متعددة.

تجدر الإشارة إلى أن بيانات التدريب للنموذج الجديد تنتهي في ديسمبر 2025، غير أن قدرات البحث المدمجة في وضع التفكير تُتيح له جزئياً استيعاب المعلومات المعاصرة وتوظيفها في الصور المولّدة. وقد أكدت الشركة أن جميع الصور الصادرة عن النموذج تحمل بيانات وصفية C2PA للكشف عن المحتوى المولّد بالذكاء الاصطناعي.

في المحصلة، يُعدّ إصدار ChatGPT Images 2.0 علامة فارقة في مسيرة الذكاء الاصطناعي التوليدي، خاصة على صعيد التطبيقات المهنية التي تشترط الدقة في التفاصيل والنصوص. والسؤال الذي يبقى مطروحاً على طاولة النقاش: هل ستظل الأداة الإبداعية بيد الإنسان، أم ستُصبح الآلة هي المنتج الأساسي للمحتوى البصري الجاهز للنشر مباشرة؟

المصدر الأصلي
TechCrunch
قراءة المقال الأصلي ↗
قصة اليوم · كل صباح

أعجبك التقرير؟ استلم واحداً كل صباح.

قصةٌ تقنية واحدة تستحقّ وقتك، بالعربية. بلا إعلانات، بلا إزعاج.

بلا إعلانات · إلغاء الاشتراك بنقرة واحدة · بياناتك آمنة

اقرأ أيضًا

المزيد من ذكاء اصطناعي

شون باركر، أحد مؤسسي نابستر ومستثمر في Stability AI

شون باركر يعيد بناء Stability AI حول صناعة الموسيقى بدعم سوني ووارنر

يقود مؤسس نابستر السابق تحولاً استراتيجياً لشركة Stability AI نحو أدوات ذكاء اصطناعي موسيقية، بتمويل جديد وشراكة مع كبرى شركات التسجيلات العالمية.

TechCrunch
شعار OpenAI على خلفية من الشيفرة البرمجية

استقالة مسؤول سلامة في OpenAI وسط اتهامات بانهيار ثقافة السلامة

استقال ديفيد روبنسون من فريق سلامة OpenAI متهماً الشركة بثقافة مؤسسية مهتزة غير مؤهلة لتطوير ذكاء اصطناعي متقدم بأمان، وسط حادثة اختراق Hugging Face.

TechCrunch
رسم تصويري لرقعة لعبة غو إلى جانب نمط متشابك من السلالم في اتجاهات مختلفة

لا تنخدعوا: النماذج اللغوية الكبيرة لا تفكر فعلاً كما تبدو

يرى باحث في الذكاء الاصطناعي أن النماذج اللغوية الكبيرة تنجح بفضل التنبؤ السريع بالأنماط لا الاستدلال المنهجي الحقيقي، مستشهداً بحركة ألفاغو الأسطورية رقم 37 كمثال على الاستدلال الفعلي الذي تفتقر إليه هذه النماذج.

MIT Technology Review
حاسوب ماك بوك إير مفتوح على مكتب يرمز إلى نظام ماك أو إس من آبل

آبل تشدد ضوابط الوصول الكامل للقرص في ماك مواجهةً لمخاطر وكلاء الذكاء الاصطناعي

أعلنت آبل تشديد صلاحية الوصول الكامل للقرص في نظام ماك أو إس، بعد تنامي المخاوف من وكلاء الذكاء الاصطناعي القادرين على الوصول غير المقيّد إلى ملفات المستخدمين ورسائلهم وسجل تصفحهم.

TechCrunch
تصور للمعالج الضوئي العصبي المستخدم لكشف مقاطع فيديو التزييف العميق

معالج ضوئي يكتشف التزييف العميق في الفيديو بدقة تقارب 98%

باحثون في جامعة كاليفورنيا لوس أنجلوس يطورون معالجاً عصبياً ضوئياً يفحص عشرات مقاطع الفيديو في آنٍ واحد باستخدام الضوء بدلاً من الكهرباء، لكشف التزييف العميق بدقة واستهلاك طاقة منخفضين.

ScienceDaily
صورة معاد بناؤها بالذكاء الاصطناعي من بيانات مسح دماغي وظيفي

علماء يطورون نظام ذكاء اصطناعي يعيد بناء الصور من مسح الدماغ في ساعة واحدة

باحثون في معهد وايزمان يطورون مُفسِّراً دماغياً بالذكاء الاصطناعي يعيد بناء ما يراه الشخص من بيانات التصوير الوظيفي، ويخفض زمن المعايرة اللازم من 40 ساعة إلى ساعة واحدة فقط.

MIT Technology Review