نماذج الذكاء الاصطناعي

أعلنت NVIDIA عن منصة RoboLab المعيارية، لحل مشكلة تقييم استراتيجيات الروبوتات العامة.

أطلقت NVIDIA منصة RoboLab للمعايرة والمحاكاة، والتي توفر مجموعة أدوات تحليلية مستقلة عن الروبوتات وقابلة للتوليد السريع للمهام، لمعالجة المشكلات الرئيسية في تقييم استراتيجيات الروبوتات الحالية مثل تداخل المجالات البصرية، تشبع المعايير، نقص التشخيص، وانخفاض الثقة الإحصائية، مما يدفع استراتيجيات الروبوتات العامة نحو التنفيذ الفعلي.

خلفية الصناعة

في السنوات الأخيرة، حققت استراتيجيات الروبوتات القائمة على النماذج الأساسية تقدمًا ملحوظًا. تستطيع الأنظمة الحديثة الأكثر تطورًا إكمال مهام الإمساك، والوضع، والتصنيف، والتلاعب بأنواع متعددة من الأشياء بناءً على تعليمات اللغة الطبيعية. ومع ذلك، مع زيادة قدرات النماذج، أصبحت كيفية تقييمها بدقة واحدة من أكثر المشكلات صعوبة التي لم تُحل بعد في الأوساط الأكاديمية والصناعية. تم تصميم منصة RoboLab المحاكاة المعيارية التي أصدرتها NVIDIA مؤخرًا لمواجهة هذه المعضلة.

العيوب الأربعة للمعايير الحالية

تشير NVIDIA إلى أن معايير تقييم الروبوتات الحالية تعاني من أربع مشكلات رئيسية:

تداخل المجال البصري

تأتي معظم بيانات التدريب والتقييم من نفس المصدر البصري. إذا تم ضبط النموذج وتقييمه في بيئة محاكاة، فإن الأداء العالي لا يعني إلا أن النموذج حفظ المشهد، وليس أنه يمتلك قدرة تعميم حقيقية. على الرغم من أن طرق الانتقال من الواقع إلى المحاكاة (Real2sim) يمكنها إنشاء بيئات واقعية من خلال الإصلاح أو إعادة بناء سحابة النقاط الغاوسية، إلا أن إعداد كل مشهد يستغرق أكثر من ساعة، مما يجعلها غير مناسبة للاختبارات واسعة النطاق.

تشبع المعايير

مجموعات المهام في العديد من المعايير ثابتة ونادرًا ما تُحدث، مما يؤدي إلى وصول النماذج بسرعة إلى الدرجة الكاملة، مما يجعل من المستحيل التمييز بين القدرات الحقيقية للنماذج. عندما تظهر جميع التقارير تقريبًا معدلات نجاح تزيد عن 90٪، تفقد الأرقام معناها.

فجوة التشخيص

لا يمكن لمؤشر النجاح/الفشل الثنائي تفسير سبب فشل الروبوت. هل هو بسبب الخلط في ألوان الأشياء؟ مشكلة في صياغة التعليمات؟ انحراف الكاميرا؟ أم ضعف كفاءة تنفيذ المهمة؟ بدون هذه الإجابات، يصعب على الباحثين إجراء التحسينات.

عدم كفاية الثقة الإحصائية

لا يمكن لمعدل النجاح الفردي وعدد عمليات التشغيل المحدود أن يعكس الأداء الحقيقي. على سبيل المثال، عند ملاحظة معدل نجاح 90٪، إذا كان عدد عمليات التشغيل 70 مرة فقط، فإن فترة الثقة 95٪ Clopper-Pearson تتراوح بين 80.5٪ و 95.9٪؛ لتقليص الخطأ إلى ±2٪، يلزم حوالي 1030 عملية تشغيل (15 ضعفًا). لكن معظم المعايير لا تحقق عدد عمليات التشغيل المطلوبة للدلالة الإحصائية.

مبادئ تصميم RoboLab الثلاثة

تم بناء منصة RoboLab من NVIDIA حول ثلاثة مبادئ:

1. تقييم المهام المستقل عن الروبوت: يمكن تقييم نفس مجموعة المهام على أشكال روبوتية وهياكل استراتيجية مختلفة، مما يتجنب مشكلة تكييف البيانات الناتجة عن التثبيت على روبوت معين. 2. توليد مهام جديدة بسرعة: عن طريق تقصير عملية إنشاء المشاهد والمهام والبيئات إلى بضع دقائق، مع دعم وكيل الترميز لتوليد المهام تلقائيًا، مما يمنع تشبع المعايير. 3. أدوات تحليل شاملة: لا توفر فقط معدل النجاح، بل تشمل أيضًا تقييم المهام المتدرج، ومقاييس جودة المسار (طول المسار ونعومة SPARC)، وسرعة التنفيذ، وتسجيل أحداث الفشل تلقائيًا (مثل الإمساك الخاطئ، والسقوط، والاصطدام)، للمساعدة في تحديد أسباب الفشل.

تصنيف قدرات المهام

  • تقوم RoboLab بتفكيك قدرات التلاعب العامة إلى ثلاث فئات:- القدرات البصرية: التعرف على الألوان والأحجام والفئات الدلالية، مثل "ضع الكوب الأحمر الصغير في الصندوق".
  • القدرات الإجرائية: تقييم الاستدلال المرتبط بالأفعال، مثل التكديس أو إعادة التوجيه أو استخدام الأدوات.
  • القدرات العلائقية: اختبار الاستدلال المكاني والمنطقي، مثل "خذ البرتقالة أو الليمونة وضعها في الوعاء".

سياق المقال · aiindustryreview

تضع aiindustryreview هذه الملاحظة ضمن نماذج الذكاء الاصطناعي / إطلاقات النماذج وادعاءات القدرة / التقييم والسلامة وإشارات الاختبار. نماذج الذكاء الاصطناعي / إطلاقات النماذج وادعاءات القدرة / التقييم والسلامة وإشارات الاختبار يوضح الزاوية التحريرية المحلية؛ ما زالت التواريخ والأسماء وتغيرات الحالة تحتاج إلى تحقق. ينبغي فتح روابط المصادر قبل إعادة استخدام الملخص.

روابط المصادر

  1. https://www.therobotreport.com/nvidia-shares-how-evaluate-general-purpose-robot-policies-real-world-deployment/أساسي

مقالات ذات صلة

العودة إلى القناة