Model AI
NVIDIA melancarkan platform penanda aras RoboLab, mengatasi masalah penilaian strategi robot universal.
NVIDIA melancarkan platform penanda aras simulasi RoboLab, yang menyediakan satu set alat analisis yang tidak bergantung kepada robot dan boleh menjana tugas dengan pantas, bagi menangani isu-isu utama dalam penilaian dasar robot semasa seperti pertindihan domain visual, ketepuan penanda aras, diagnosis yang tidak mencukupi dan keyakinan statistik yang rendah, seterusnya mendorong dasar robot umum ke arah penggunaan sebenar.
Latar Belakang Industri
Dalam tahun-tahun kebelakangan ini, strategi robot berdasarkan model asas telah mencapai kemajuan yang ketara. Sistem optimum kontemporari mampu melaksanakan tugas meraih, meletak, mengklasifikasi, dan mengendalikan pelbagai objek berdasarkan arahan bahasa semula jadi. Namun, seiring dengan peningkatan keupayaan model, cara menilai secara ketat merupakan salah satu cabaran paling sukar yang belum selesai dalam kalangan akademik dan industri. Platform penanda aras simulasi RoboLab yang terbaru dikeluarkan oleh NVIDIA direka khusus untuk menangani masalah ini.
Empat Kekurangan Penanda Aras Semasa
NVIDIA menunjukkan bahawa penanda aras penilaian robot sedia ada umumnya mempunyai empat isu utama:
Pertindihan Domain Visual
Kebanyakan data latihan dan penilaian berasal dari sumber visual yang sama. Jika model dilaras dan dinilai dalam persekitaran simulasi, prestasi tinggi hanya menunjukkan model telah menghafal senario, bukan benar-benar mempunyai keupayaan generalisasi. Kaedah Real2sim (realiti ke simulasi) mampu menjana persekitaran realistik melalui pembaikan atau pembinaan semula awan titik Gaussian, tetapi setiap senario memerlukan lebih dari satu jam untuk disediakan, menjadikannya tidak sesuai untuk ujian berskala besar.
Ketepuan Penanda Aras
Set tugas dalam banyak penanda aras adalah tetap dan jarang dikemas kini, menyebabkan model cepat mencapai markah penuh dan tidak dapat membezakan keupayaan sebenar model. Apabila hampir semua laporan menunjukkan kadar kejayaan melebihi 90%, angka tersebut kehilangan maknanya.
Kekosongan Diagnostik
Metrik kejayaan/kegagalan binari tidak dapat menjelaskan sebab kegagalan robot. Adakah disebabkan kekeliruan warna objek? Masalah penyusunan arahan? Penyimpangan kamera? Atau kecekapan pelaksanaan tugas yang rendah? Tanpa jawapan ini, penyelidik sukar untuk membuat penambahbaikan.
Kekurangan Keyakinan Statistik
Kadar kejayaan sekali dan bilangan rollout yang terhadap tidak mencerminkan prestasi sebenar. Contohnya, apabila kadar kejayaan 90% diperhatikan, jika bilangan rollout hanya 70 kali, selang keyakinan 95% Clopper-Pearson adalah dari 80.5% hingga 95.9%; jika perlu mengecilkan ralat kepada ±2%, diperlukan kira-kira 1030 rollout (15 kali ganda). Namun kebanyakan penanda aras tidak mencapai bilangan rollout yang signifikan secara statistik.
Tiga Prinsip Reka Bentuk RoboLab
Platform RoboLab NVIDIA dibina berdasarkan tiga prinsip:
1. Penilaian tugas bebas robot: Set tugas yang sama boleh dinilai pada pelbagai bentuk dan seni bina strategi robot, mengelakkan masalah penyesuaian data akibat robot tetap. 2. Penjanaan tugas baru yang pantas: Dengan memendekkan proses penjanaan senario, tugas, dan persekitaran kepada beberapa minit, serta menyokong ejen pengekodan untuk menjana tugas secara automatik, bagi mengelakkan ketepuan penanda aras. 3. Alat analisis menyeluruh: Bukan sahaja menyediakan kadar kejayaan, tetapi juga skor tugas berperingkat, metrik kualiti trajektori (panjang laluan dan kelancaran SPARC), kelajuan pelaksanaan, serta merekod secara automatik peristiwa kegagalan (seperti cengkaman salah, jatuh, perlanggaran) untuk membantu mengenal pasti punca kegagalan.
Pengelasan Keupayaan Tugas
- RoboLab membahagikan keupayaan operasi umum kepada tiga kategori:- Keupayaan Visual: mengenal pasti warna, saiz dan kategori semantik, contohnya, "Masukkan cawan merah kecil ke dalam kotak".
- Keupayaan Prosedur: menilai penaakulan berkaitan tindakan, seperti menyusun, mengorientasi semula atau menggunakan alat.
- Keupayaan Perhubungan: menguji penaakulan spatial dan logik, contohnya, "Ambil oren atau limau, dan masukkan ke dalam mangkuk".
Konteks artikel · aiindustryreview
aiindustryreview meletakkan nota ini dalam AI Industry Review menerbitkan analisis dan taklimat berbilang bahasa.. Model AI / Pelancaran model dan dakwaan keupayaan / Penilaian, keselamatan dan isyarat penanda aras menerangkan sudut editorial setempat; tarikh, nama dan perubahan status masih perlu disemak. Pautan sumber perlu dibuka sebelum ringkasan digunakan semula.