Model AI

Model besar 'ajar' model besar: Bagaimana kemas kini ganjaran GRPO mengurangkan kos latihan penaakulan AI dan meningkatkan kecekapan penyesuaian model perusahaan

Kajian terbaru Scientific Reports mencadangkan penggunaan model besar untuk menjana data penaakulan, dan melalui pengemaskinian mekanisme ganjaran GRPO untuk meningkatkan keupayaan penaakulan LLM yang lain, dengan kos latihan hanya kira-kira 80 dolar AS. Artikel ini mentafsir kesannya terhadap kecekapan latihan AI dan aplikasi perusahaan dari perspektif industri.

Latar Belakang Industri | Industry Context

Pada masa kini dengan perkembangan pesat industri AI, halangan terbesar bagi perusahaan untuk menggunakan model besar selalunya bukan model itu sendiri, tetapi data "rantai pemikiran" (Chain-of-Thought) berkualiti tinggi yang diperlukan untuk penalaan halus dalam domain tertentu. Pemerolehan data sedemikian bukan sahaja mahal, malah memerlukan pelabelan oleh pakar domain, yang sangat menghalang penerapan AI dalam industri menegak seperti kewangan, undang-undang, dan perubatan. Satu kajian yang baru diterbitkan dalam *Scientific Reports* mencadangkan satu penyelesaian, iaitu menggunakan model besar sedia ada untuk menjana data penaakulan secara automatik, dan memperbaiki fungsi ganjaran GRPO (Group Relative Policy Optimization) untuk mengoptimumkan model sasaran, dengan itu mengurangkan kos latihan kepada tahap ratusan dolar AS. Kemajuan ini dijangka membentuk semula ekonomi penyesuaian model AI.

Kesan Pasaran | Market Impact

Kesan industri yang paling langsung daripada kajian ini ialah penurunan mendadak kos latihan. Eksperimen menunjukkan bahawa model berdasarkan Qwen 2.5-3B-Instruct mencapai purata ketepatan token masing-masing 98.2% dan 98.5% pada set data GSM8K dan surat Buffett kepada pemegang saham, dengan masa latihan hanya 40-42 jam dan kos kira-kira 78-82 dolar AS. Angka ini jauh lebih rendah daripada kos penalaan halus tradisional yang sering mencecah ribuan dolar, bermakna perusahaan kecil dan sederhana juga mampu menanggung kos penyesuaian model untuk data perniagaan mereka sendiri. Bagi penyedia kuasa pengkomputeran, latihan kos rendah mungkin membawa lebih banyak permintaan latihan penaakulan berskala kecil dan berfrekuensi tinggi, manakala penyedia perkhidmatan model perlu menyesuaikan strategi harga mereka.

Landskap Persaingan | Competitive Landscape

Dalam aliran teknologi ini, beberapa jenis pemain mungkin mendapat manfaat: pertama, syarikat rantaian alat model, seperti platform yang menyediakan perkhidmatan penjanaan data dan pengoptimuman latihan; kedua, komuniti model sumber terbuka, kerana latihan kos rendah akan menarik lebih ramai pembangun untuk membangunkan semula model sumber terbuka (seperti Qwen); ketiga, penyedia perkhidmatan awan, walaupun kos latihan sekali menurun, peningkatan bilangan latihan keseluruhan mungkin mendorong jumlah penggunaan kuasa pengkomputeran meningkat. Sementara itu, penyedia perkhidmatan pelabelan data tradisional dan penalaan halus manual menghadapi tekanan, kerana kaedah menjana data penaakulan secara automatik sedang menggantikan sebahagian kerja manual. Yang perlu diberi perhatian ialah makmal AI besar seperti OpenAI, Anthropic, dan lain-lain mempunyai keupayaan penjanaan model yang lebih kuat, dan kos panggilan API mereka sebagai "model guru" mungkin menjadi model perniagaan baharu.

Implikasi Perusahaan | Enterprise Implications Untuk pembuat keputusan perusahaan, kajian ini memberikan isyarat yang jelas: ambang untuk penyesuaian model semakin menurun dengan ketara. Perusahaan harus menilai senario dalam perniagaan mereka yang boleh menjana data penaakulan secara automatik, dan memberi perhatian kepada alat sumber terbuka seperti Huggify-Data, CoT Data Generator. Pada masa yang sama, apabila memperkenalkan fungsi objektif pembelajaran pengukuhan seperti GRPO, perlu memahami reka bentuk mekanisme ganjarannya, terutamanya bagaimana komponen ganjaran berstruktur memastikan format output mematuhi keperluan. Perusahaan harus mengelak daripada menggunakan model umum secara langsung untuk tugasan tertentu, sebaliknya menggunakan kaedah latihan kos rendah ini untuk mencapai penyesuaian pantas. Selain itu, memandangkan kajian ini menerbitkan set data dan model, perusahaan boleh menjalankan pembangunan sekunder berdasarkannya untuk memendekkan kitaran pengesahan.

未来展望 | Outlook

Meninjau 12 bulan akan datang, teknologi penyesuaian model kos rendah akan semakin menembusi industri menegak, terutamanya dalam bidang kewangan dan undang-undang, kerana kedua-dua bidang ini mempunyai keperluan yang jelas untuk penstrukturan dokumen dan penaakulan logik. Dalam tempoh 24 bulan, platform "penalaan halus model sebagai perkhidmatan" mungkin akan muncul untuk pelbagai industri, membolehkan perusahaan tidak perlu menguruskan proses latihan sendiri. Dalam tempoh 3 tahun, apabila kos inferens terus menurun, penyesuaian model besar akan beralih daripada eksperimen khusus kepada pilihan lalai perusahaan. Pada masa yang sama, pihak pengawalseliaan perlu memberi perhatian kepada risiko keselamatan data dan konsistensi model yang mungkin ditimbulkan oleh kaedah latihan ini, contohnya bagaimana mengelakkan pemindahan bias apabila menggunakan model guru untuk menjana data.

Konteks artikel · aiindustryreview

aiindustryreview meletakkan nota ini dalam AI Industry Review menerbitkan analisis dan taklimat berbilang bahasa.. Model AI / Pelancaran model dan dakwaan keupayaan / Penilaian, keselamatan dan isyarat penanda aras menerangkan sudut editorial setempat; tarikh, nama dan perubahan status masih perlu disemak. Pautan sumber perlu dibuka sebelum ringkasan digunakan semula.

Pautan sumber

  1. https://www.nature.com/articles/s41598-026-39296-8Utama

Artikel berkaitan

Kembali ke saluran