نماذج الذكاء الاصطناعي

النماذج الكبيرة «تعلّم» النماذج الكبيرة: كيف يقلل تحديث المكافآت GRPO من تكاليف تدريب الاستدلال بالذكاء الاصطناعي ويرفع كفاءة تخصيص النماذج للمؤسسات

دراسة حديثة في Scientific Reports تقترح استخدام نموذج كبير لتوليد بيانات الاستدلال، وتعزيز قدرات الاستدلال لنموذج لغوي كبير آخر عبر تحديث آلية مكافآت GRPO، بتكلفة تدريب تبلغ حوالي 80 دولارًا فقط. يفسر هذا المقال من منظور صناعي تأثيره على كفاءة تدريب الذكاء الاصطناعي وتطبيقات المؤسسات.

خلفية الصناعة | Industry Context

في ظل التطور السريع لصناعة الذكاء الاصطناعي اليوم، لا يكمن غالبًا أكبر عائق أمام نشر المؤسسات للنماذج الكبيرة في النموذج نفسه، بل في بيانات “سلسلة التفكير” (Chain-of-Thought) عالية الجودة اللازمة للضبط الدقيق لمجال معين. فالحصول على هذه البيانات ليس مكلفًا فحسب، بل يتطلب أيضًا تعليقات من خبراء المجال، مما يعيق بشدة تطبيق الذكاء الاصطناعي في القطاعات الرأسية مثل التمويل والقانون والرعاية الصحية. وقد اقترحت دراسة نُشرت مؤخرًا في "Scientific Reports" مجموعة من الحلول، تستخدم النماذج الكبيرة الموجودة لتوليد بيانات الاستدلال تلقائيًا، وتحسّن النموذج المستهدف من خلال تحسين دالة المكافأة في GRPO (Group Relative Policy Optimization)، مما يخفض تكلفة التدريب إلى مستوى مئات الدولارات. ومن المتوقع أن يعيد هذا التقدم تشكيل اقتصاديات تخصيص نماذج الذكاء الاصطناعي.

تأثير السوق | Market Impact

إن التأثير الصناعي الأكثر مباشرة لهذه الدراسة هو الانخفاض الحاد في تكاليف التدريب. أظهرت التجارب أن النموذج المستند إلى Qwen 2.5-3B-Instruct حقق متوسط دقة للرموز (token) بلغ 98.2% و98.5% على مجموعتي بيانات GSM8K ورسائل وارن بافيت إلى المساهمين على التوالي، في حين أن وقت التدريب كان 40-42 ساعة فقط، وبلغت التكلفة حوالي 78-82 دولارًا. وهذا الرقم أقل بكثير من تكلفة الضبط الدقيق التقليدي التي تصل غالبًا إلى آلاف الدولارات، مما يعني أن المؤسسات الصغيرة والمتوسطة قادرة أيضًا على تحمل تكلفة تخصيص النماذج وفقًا لبيانات أعمالها. وبالنسبة لمزودي القدرة الحاسوبية، قد يؤدي التدريب منخفض التكلفة إلى جلب المزيد من الطلبات على تدريب الاستدلال صغير النطاق وعالي التكرار، بينما يتعين على مزودي خدمات النماذج تعديل استراتيجيات التسعير.

المشهد التنافسي | Competitive Landscape

في هذا الاتجاه التقني، قد تستفيد الفئات التالية من الأطراف: أولًا، شركات أدوات سلسلة النماذج، مثل المنصات التي تقدم خدمات توليد البيانات وتحسين التدريب؛ ثانيًا، مجتمع النماذج مفتوحة المصدر، حيث سيجذب التدريب منخفض التكلفة المزيد من المطورين للتطوير الثانوي بناءً على النماذج مفتوحة المصدر (مثل Qwen)؛ ثالثًا، مزودو الخدمات السحابية، فعلى الرغم من انخفاض تكلفة التدريب الواحد، فإن الزيادة في العدد الإجمالي لعمليات التدريب قد ترفع إجمالي استهلاك القدرة الحاسوبية. أما مقدمو خدمات تعليق البيانات والضبط الدقيق اليدوي التقليديون فيواجهون ضغوطًا، لأن أسلوب توليد بيانات الاستدلال تلقائيًا يحل محل جزء من العمل اليدوي. ومن الجدير بالاهتمام أن مختبرات الذكاء الاصطناعي الكبرى مثل OpenAI وAnthropic تمتلك قدرات أقوى على توليد النماذج، وقد تصبح تكلفة استدعاء واجهة البرمجة (API) الخاصة بها، بوصفها "نموذجًا معلمًا"، نموذجًا تجاريًا جديدًا.

الآثار على المؤسسات | Enterprise Implicationsبالنسبة لصناع القرار في المؤسسات، يحمل هذا البحث إشارة واضحة: إن عتبة تخصيص النماذج آخذة في الانخفاض بشكل كبير. ينبغي على المؤسسات تقييم السيناريوهات في أعمالها التي يمكن أن تولّد بيانات الاستدلال تلقائيًا، والاهتمام بالأدوات مفتوحة المصدر مثل Huggify-Data وCoT Data Generator. وفي الوقت نفسه، عند إدخال دوال الهدف للتعلم المعزز مثل GRPO، يجب فهم تصميم آلية المكافآت، ولا سيما كيفية ضمان مكونات المكافآت المنظمة للامتثال لتنسيق المخرجات. وينبغي على المؤسسات تجنب استخدام النماذج العامة مباشرة في مهام محددة، بل تحقيق التكيف السريع من خلال وسائل التدريب منخفضة التكلفة هذه. بالإضافة إلى ذلك، نظرًا لأن البحث أتاح مجموعات البيانات والنماذج علنًا، يمكن للمؤسسات إجراء تطوير ثانوي على هذا الأساس لتقصير دورة التحقق.

نظرة مستقبلية | Outlook

وبتطلع إلى الأشهر الاثني عشر المقبلة، ستتسارع تقنيات تخصيص النماذج منخفضة التكلفة في الانتشار إلى الصناعات الرأسية، لا سيما قطاعا التمويل والقانون، نظرًا للحاجة الواضحة إلى هيكلة المستندات والاستدلال المنطقي في هذين المجالين. وخلال 24 شهرًا، قد تظهر منصات «الضبط الدقيق للنماذج كخدمة» موجهة لمختلف الصناعات، دون حاجة المؤسسات إلى إدارة عمليات التدريب بنفسها. وخلال 3 سنوات، ومع استمرار انخفاض تكاليف الاستدلال، سينتقل تخصيص النماذج الكبيرة من تجارب متخصصة محدودة إلى خيار افتراضي للمؤسسات. وفي الوقت نفسه، يتعين على الجهات التنظيمية الانتباه إلى مخاطر أمن البيانات واتساق النماذج التي قد يترتب على أسلوب التدريب هذا، مثل كيفية تجنب نقل التحيز عند استخدام نموذج المعلم لتوليد البيانات.

سياق المقال · aiindustryreview

تضع aiindustryreview هذه الملاحظة ضمن نماذج الذكاء الاصطناعي / إطلاقات النماذج وادعاءات القدرة / التقييم والسلامة وإشارات الاختبار. نماذج الذكاء الاصطناعي / إطلاقات النماذج وادعاءات القدرة / التقييم والسلامة وإشارات الاختبار يوضح الزاوية التحريرية المحلية؛ ما زالت التواريخ والأسماء وتغيرات الحالة تحتاج إلى تحقق. ينبغي فتح روابط المصادر قبل إعادة استخدام الملخص.

روابط المصادر

  1. https://www.nature.com/articles/s41598-026-39296-8أساسي

مقالات ذات صلة

العودة إلى القناة