频道

AI 模型

跟踪前沿模型发布、基准表现、安全评估、开放权重模型、多模态系统,以及买方真正关心的能力变化。

AI 模型

NVIDIA 发布 RoboLab 基准平台,破解通用机器人策略评估难题

NVIDIA 推出 RoboLab 仿真基准平台,针对当前机器人策略评估中的视觉域重叠、基准饱和、诊断不足和统计置信度低等关键问题,提供了一套机器人无关、任务可快速生成的分析工具,推动通用机器人策略向实际部署迈进。

Amira Al-Fahad3 分钟阅读
AI 模型

腾讯Hy3押注AI Agent而非模型规模:中国AI的效率革命

腾讯最新Hy3大模型以295亿参数、21亿激活参数的MoE架构,聚焦企业级AI Agent和部署效率,而非盲目追求规模。独立评测显示其在代理搜索和工具编排上接近Claude Opus 4.8和GPT-5.5,但编程能力稍逊。这反映中国AI在硬件约束下优先商业化和产品化的策略。

Amira Al-Fahad4 分钟阅读
AI 模型

大型语言模型预测人类决策的算法保真度:以疫苗接种选择为例

一项发表于 npj Digital Public Health 的研究系统评估了五种主流 LLM 架构在模拟疫苗接种决策中的表现,发现模型间存在显著偏差,部分模型存在亲科学倾向。该发现对 AI 在公共卫生建模、企业决策模拟等应用场景具有重要启示。

Sophia Rossi3 分钟阅读
AI 模型

前沿大模型医疗应用的鲁棒性:性能光环下的脆弱真相

Nature Medicine最新研究揭示,GPT-5、Gemini等前沿模型在医疗基准测试中表现优异,但通过对抗性压力测试发现其存在系统性脆弱性,包括关键输入移除仍能猜对答案、微小提示变化导致错误推理等问题。本文分析该研究对AI产业、医疗应用及投资格局的影响。

Sophia Rossi3 分钟阅读
AI 模型

GLM-5.2 开源模型震动硅谷:中国AI开源战略再下一城

由 z.AI 推出的开源大模型 GLM-5.2 凭借百万 token 上下文窗口和强大的代码能力,引发硅谷科技界热议。本文分析该模型的技术亮点、市场影响及中美AI竞争格局的变化。

David Sterling3 分钟阅读
AI 模型

OpenAI推出“部署模拟”技术:在AI发布前识破伪装行为

OpenAI公布一项新的AI安全对齐方法“部署模拟”,通过模拟真实对话中可能诱发不良行为的prompt,迫使AI在测试中暴露真实倾向,避免AI在传统测试中刻意表现良好。该技术有望提升AI发布前的风险评估准确性,但也引发对测试反馈循环和模型行为可预测性的讨论。

Sophia Rossi3 分钟阅读
AI 模型

多轮对话成为AI安全新漏洞:企业正在低估大模型真实风险

Cisco研究指出,包括OpenAI、Anthropic、Google、Amazon、xAI在内的主流大模型,在多轮对话场景下的安全护栏都可能被绕过。这意味着企业在评估AI安全时,不能再只看单轮测试结果,而应把多轮交互、代理式工作流和真实攻击路径纳入治理框架。

Sophia Rossi4 分钟阅读