الأطفال يتفوقون على نماذج اللغة الكبيرة في تعلم اللغة رغم فجوة البيانات الهائلة
يتقن الأطفال لغاتهم بعد عشرات الملايين من الكلمات بينما تحتاج نماذج اللغة الكبيرة إلى تريليونات الرموز، وتسعى الأبحاث الحديثة لفهم هذه الكفاءة الاستثنائية لبناء ذكاء اصطناعي أكثر كفاءةً.

في عصر تُدرَّب فيه نماذج اللغة الكبيرة على كميات من البيانات تفوق ما قرأه البشر في كل التاريخ المكتوب، يبقى الطفل البشري اللغز الذي يُحيّر باحثي الذكاء الاصطناعي: كيف يُتقن الطفل لغته الأم بعد سماع عشرة إلى ثلاثين مليون كلمة فقط، في حين يحتاج نموذج كـLlama 3.1 من Meta إلى خمسة عشر تريليون رمز مميز - ما يُعادل مئة ألف ضعف من البيانات - لتحقيق مستوى مقارب من الطلاقة اللغوية؟
هذه هي قضية «فجوة كفاءة البيانات»، وهي إحدى أعمق الأسئلة في الذكاء الاصطناعي المعاصر، وموضوع مقالة نشرتها مجلة MIT Technology Review في الرابع والعشرين من أغسطس 2026.
سباق BabyLM
عام 2022، أطلق أليكس ووردستات وزملاؤه مسابقة BabyLM السنوية، التي تُدرِّب نماذج لغوية على مجموعات بيانات «مناسبة للتطور البشري» لا تتجاوز مئة مليون كلمة مستقاة من كتب الأطفال والحوارات اليومية ونصوص المسلسلات. الهدف: استكشاف ما إذا كان التدريب المسبق بالبيانات المحدودة قادراً على إنتاج نماذج أكثر كفاءةً تُحاكي التعلم البشري.
النتيجة مُدهشة: في مسابقة 2024، تمكّن الفائز GPT-BERT من التفوق على نموذج Llama 2 الضخم ذي السبعين مليار معامل في عدة معايير مرجعية، رغم استخدامه خمسة عشر ألف مرة أقل من البيانات في مرحلة التدريب المسبق.
دور التعلم متعدد الوسائط
يُشير الباحثون إلى أن الطفل لا يتعلم اللغة من النص وحده. إنه يسمع ويرى ويلمس ويتفاعل مع بيئته، ويُولّد خبرات تعليمية بنفسه عبر الإشارة والحركة والتواصل الاجتماعي. هذا التعلم المتعدد الوسائط والتفاعلي يمنح الدماغ البشري ميزة هائلة يفتقر إليها نموذج اللغة الكبير التقليدي الذي يتعلم من نص جامد.
أجرى برندان ليك وأوري هاسون تجارب بتدريب نماذج ذكاء اصطناعي على مقاطع فيديو مصوّرة من منظور الأطفال الرضّع خلال ساعات يقظتهم اليومية. النتائج الأولية مشجعة: النماذج الصغيرة المدرَّبة على هذه البيانات الغنية بالسياق أبدت فهماً أعمق لمعاني الكلمات مقارنةً بنماذج أكبر مُدرَّبة على نص صرف.
نماذج اللغة المُقنَّعة وأسلوب التعلم التدريجي
من الأساليب التي استُكشفت في هذا الإطار نموذج اللغة بالإخفاء، الذي يتعلم التنبؤ بكلمات محجوبة من النص، مما يجبر النموذج على فهم السياق من الاتجاهين. كما استُكشف أسلوب التعلم المنهجي التدريجي الذي يبدأ بأمثلة بسيطة ثم يتصاعد تدريجياً في التعقيد، محاكياً المناهج الطبيعية للتعلم البشري. غير أن الدراسات تُشير إلى أن هذا الترتيب وحده لا يكفي لردم الفجوة.
الأفق المستقبلي
فهم الكفاءة البيولوجية البشرية له تداعيات عملية بالغة: نماذج أكثر كفاءةً في استخدام البيانات تعني إمكانية بناء ذكاء اصطناعي قوي للغات الأقل حضوراً على الإنترنت، من اللغات الأصيلة والإقليمية حول العالم - بما في ذلك العربية بلهجاتها المتعددة وسياقاتها الثقافية الثرية. كما تعني تخفيض الكلفة الحسابية الهائلة لتدريب النماذج الحالية.
الأطفال، مرةً أخرى، يُعلّمون الآلة - لا باستخدامها، بل بكونهم نموذجاً يستحق الدراسة العميقة.
المزيد من ذكاء اصطناعي

كهف دريمولين يكشف وصول الإنسان المنتصب إلى جنوب أفريقيا أبكر بـ200 ألف سنة
حفرية جمجمة بالغة من كهف دريمولين بجنوب أفريقيا تشير إلى أن الإنسان المنتصب وصل إلى المنطقة قبل نحو مليوني سنة، أي أبكر بـ200 ألف سنة من التقديرات السابقة المستندة إلى موقع دمانيسي في جورجيا.

جوجل تحوّل Gemini إلى عامل ذكاء اصطناعي ينفّذ المهام ويملك بريد عمل خاصاً به
أعلنت جوجل تزويد Gemini بقدرات الذكاء الاصطناعي الوكيل لتنفيذ مهام متعددة الخطوات داخل برمجيات الشركات، وتوزيعها على عملاء فرعيين، ومزج نماذج مختلفة بما فيها نماذج Anthropic، مع منح العامل حساب بريد عمل مستقل يتعامل معه الموظفون كزميل.

مسبار آينشتاين يكشف عشر دقائق من أشعة إكس اللينة تلت انفجار غاما قصيرًا
رصد مسبار آينشتاين الفضائي انبعاثًا من أشعة إكس اللينة استمر نحو عشر دقائق بعد انفجار أشعة غاما قصير، في إشارة محتملة إلى ولادة نجم مغناطيسي عقب اندماج نجمين نيوترونيين.

تقرير: إيرادات OpenAI السنوية أقل بـ20 مليار دولار من الأرقام المعلنة سابقاً
تقرير جديد لصحيفة فايننشال تايمز يكشف أن الإيراد السنوي المُقدَّر لشركة OpenAI أقرب إلى 50 مليار دولار لا 70 مليار كما ذُكر سابقاً، وسط خلاف حول منهجية حساب الإيراد مقارنة بمنافستها Anthropic.

ويمو تؤمّن قرضاً بـ5 مليارات دولار من بلاكستون وبيمكو لتوسيع الأجرة الذاتية
أعلنت ويمو، شركة القيادة الذاتية التابعة لألفابت، إغلاق قرض بقيمة 5 مليارات دولار من بلاكستون وبيمكو وجهات أخرى، في أول استخدام للشركة لتمويل الدين لدعم توسعها في السوق الأمريكية وخارجها.

غودفاير تطرح مراقبات داخلية ترصد عملاء الذكاء الاصطناعي المارقين بتكلفة أقل
شركة التفسيرية غودفاير تكشف عن مراقبات تفحص النشاط الداخلي لنماذج الذكاء الاصطناعي أثناء عملها، بدل مراجعة كل خطوة بنموذج ثانٍ، فتخفض التكلفة وتضبط عملاء الذكاء الاصطناعي المارقين بسرعة أكبر.