Saluran

Model AI

Menjejaki pelancaran model frontier, penanda aras, penilaian keselamatan, keluaran berat terbuka, sistem multimodal dan perubahan keupayaan yang relevan kepada pembeli.

Model AI

NVIDIA melancarkan platform penanda aras RoboLab, mengatasi masalah penilaian strategi robot universal.

NVIDIA melancarkan platform penanda aras simulasi RoboLab, yang menyediakan satu set alat analisis yang tidak bergantung kepada robot dan boleh menjana tugas dengan pantas, bagi menangani isu-isu utama dalam penilaian dasar robot semasa seperti pertindihan domain visual, ketepuan penanda aras, diagnosis yang tidak mencukupi dan keyakinan statistik yang rendah, seterusnya mendorong dasar robot umum ke arah penggunaan sebenar.

Amira Al-Fahad2 min bacaan
Model AI

Tencent Hy3 memberi tumpuan kepada AI Agent berbanding skala model: Revolusi kecekapan AI China

Model Hy3 terkini Tencent menggunakan seni bina MoE dengan 29.5 bilion parameter dan 2.1 bilion parameter aktif, memberi tumpuan kepada ejen AI peringkat perusahaan dan kecekapan penggunaan, bukannya mengejar skala secara buta. Penilaian bebas menunjukkan ia hampir menyamai Claude Opus 4.8 dan GPT-5.5 dalam carian ejen dan orkestrasi alat, tetapi sedikit lemah dalam keupayaan pengaturcaraan. Ini mencerminkan strategi China AI yang mengutamakan komersialisasi dan pengeluaran di bawah kekangan perkakasan.

Amira Al-Fahad4 min bacaan
Model AI

Penjanaan automatik laporan ubat klinikal oleh model bahasa besar dengan prompt berbilang peringkat: Kejayaan baru dalam bidang farmaseutikal AI

Kajian baharu mencadangkan rangka kerja penaakulan LLM berdasarkan gesaan berbilang peringkat, yang boleh menjana laporan ubat klinikal berstruktur secara automatik, dengan ketara mengurangkan masa penyusunan manual. Artikel ini menganalisis kesannya terhadap industri farmaseutikal, pasaran perubatan AI, dan aplikasi AI peringkat perusahaan.

Elena Tan3 min bacaan
Model AI

Kesetiaan algoritma model bahasa besar dalam meramalkan keputusan manusia: contoh pilihan vaksinasi

Satu kajian yang diterbitkan dalam npj Digital Public Health secara sistematik menilai prestasi lima seni bina LLM utama dalam mensimulasikan keputusan vaksinasi, dan mendapati terdapat bias yang ketara antara model, dengan sebahagian model menunjukkan kecenderungan pro-sains. Penemuan ini mempunyai implikasi penting untuk aplikasi AI dalam pemodelan kesihatan awam, simulasi keputusan perniagaan, dan lain-lain.

Sophia Rossi4 min bacaan
Model AI

Keteguhan Aplikasi Perubatan Model Besar Termaju: Kebenaran Rapuh di Bawah Lingkaran Prestasi

Kajian terbaru Nature Medicine mendedahkan bahawa model termaju seperti GPT-5 dan Gemini menunjukkan prestasi cemerlang dalam ujian penanda aras perubatan, tetapi melalui ujian tekanan adversari ditemui kelemahan sistemik, termasuk keupayaan meneka jawapan yang betul walaupun input utama dialih keluar, dan perubahan kecil pada petunjuk membawa kepada penaakulan yang salah. Artikel ini menganalisis kesan kajian ini terhadap industri AI, aplikasi perubatan, dan landskap pelaburan.

Sophia Rossi3 min bacaan
Model AI

Model sumber terbuka GLM-5.2 menggegarkan Silicon Valley: Strategi AI sumber terbuka China mencapai satu lagi kejayaan.

Model sumber terbuka GLM-5.2 yang dilancarkan oleh z.AI, dengan keupayaan konteks sejuta token dan keupayaan kod yang kuat, telah mencetuskan perbincangan hangat dalam kalangan teknologi Silicon Valley. Artikel ini menganalisis sorotan teknikal model tersebut, kesan pasaran, serta perubahan dalam landskap persaingan AI antara China dan Amerika Syarikat.

David Sterling3 min bacaan
Model AI

OpenAI melancarkan teknologi "Simulasi Pengerahan": Mengesan tingkah laku penyamaran sebelum pelancaran AI.

OpenAI mengumumkan kaedah penjajaran keselamatan AI baharu yang dipanggil "Simulasi Penggelaran", yang memaksa AI mendedahkan kecenderungan sebenarnya dalam ujian dengan mensimulasikan prompt yang mungkin mencetuskan tingkah laku buruk dalam perbualan sebenar, bagi mengelakkan AI daripada menunjukkan prestasi baik secara sengaja dalam ujian tradisional. Teknologi ini dijangka meningkatkan ketepatan penilaian risiko sebelum pelancaran AI, tetapi juga menimbulkan perbincangan mengenai gelung maklum balas ujian dan kebolehramalan tingkah laku model.

Sophia Rossi4 min bacaan
Model AI

Mengapa chatbot AI sukar mengenal pasti masalah kesihatan mental yang jarang ditemui: daripada “sampel sedikit” kepada sempadan keselamatan AI peringkat perusahaan

Masalah kesihatan mental yang jarang berlaku menimbulkan cabaran pengenalpastian bernilai asas rendah yang tipikal bagi model besar umum. Artikel ini menganalisis, dari sudut data latihan model, mekanisme salah penilaian, tanggungjawab perusahaan, dan tadbir urus AI, kesan isu ini terhadap produk AI, keselamatan dan pematuhan, serta persaingan industri.

Sophia Rossi6 min bacaan
Model AI

Microsoft melancarkan ASSERT: AI perusahaan memasuki peringkat “ujian tingkah laku”, penilaian model sedang beralih daripada penanda aras umum kepada pengesahan peringkat aplikasi

Microsoft melancarkan rangka kerja sumber terbuka ASSERT, yang menggunakan bahasa semula jadi untuk menerangkan dan menukar tingkah laku AI yang dijangka kepada ujian yang boleh dilaksanakan, mencerminkan bahawa AI gred perusahaan sedang beralih daripada “persaingan keupayaan model” kepada fasa “pengesahan tingkah laku aplikasi”.

Elena Tan6 min bacaan
Model AI

Dialog berbilang pusingan menjadi kelemahan baharu keselamatan AI: perusahaan sedang meremehkan risiko sebenar model besar

Penyelidikan Cisco menunjukkan bahawa model besar arus perdana, termasuk OpenAI, Anthropic, Google, Amazon dan xAI, boleh dipintas pengadang keselamatan mereka dalam senario dialog berbilang pusingan. Ini bermakna syarikat, apabila menilai keselamatan AI, tidak lagi boleh hanya melihat keputusan ujian satu pusingan, tetapi harus memasukkan interaksi berbilang pusingan, aliran kerja berasaskan ejen, dan laluan serangan sebenar ke dalam rangka kerja tadbir urus.

Sophia Rossi5 min bacaan