AI 模型

多轮对话成为AI安全新漏洞:企业正在低估大模型真实风险

Cisco研究指出,包括OpenAI、Anthropic、Google、Amazon、xAI在内的主流大模型,在多轮对话场景下的安全护栏都可能被绕过。这意味着企业在评估AI安全时,不能再只看单轮测试结果,而应把多轮交互、代理式工作流和真实攻击路径纳入治理框架。

Industry Context

随着企业把大模型嵌入客服、办公、检索、开发和安全运营流程,AI安全评估正在从“模型是否会直接拒答”转向“模型在连续交互中会不会被逐步操控”。Cisco研究人员近日对多个主流与前沿模型进行了测试,覆盖 OpenAI 的 ChatGPT、Anthropic 的 Claude、Google Gemini、Amazon Nova、xAI 的 Grok 等,结论是:没有任何一个模型能在多轮对话操控面前被视为完全安全

这项发现的重要性不在于“模型会不会偶发失误”,而在于它揭示了企业常用评测框架的结构性缺陷。当前很多安全基准仍偏向单轮提示词测试,但现实攻击往往是渐进式的:攻击者会分解任务、改变叙事、借用角色扮演、通过歧义和上下文重构不断试探模型边界。Cisco的判断很明确:多轮评测之所以重要,是因为真实攻击者本来就会反复迭代。

Market Impact

对于企业客户而言,这意味着AI部署的风险边界被重新定义。若组织只依据单次测试通过结果决定是否上线,可能高估模型在实际业务流程中的稳定性。特别是在面向外部客户的客服系统、内部知识助手、销售自动化和AI Agent场景中,连续对话本身就是默认交互方式,安全护栏一旦在多轮过程中松动,风险将从“内容不合规”扩大到“权限越界、流程误导、数据暴露和错误操作”。

对投资者而言,这类研究通常会重新抬高企业级AI采购中的安全预算权重。模型能力仍然是核心卖点,但安全性正在从辅助指标变成决定大规模采购能否持续的前置条件。那些能够提供更强测试、监控、审计与策略控制能力的AI安全公司、模型评测平台和推理层治理工具,可能在企业预算中获得更高优先级。

值得注意的是,研究还指出模型配置会影响脆弱性。例如,Grok在开启“reasoning mode”后,安全保护更容易被绕过。这类发现对企业的意义在于:风险并不只取决于模型本身,也取决于部署方式、功能开关和工作流设计。换言之,同一个模型在不同配置下,可能对应完全不同的风险曲线。

Competitive Landscape

从产业竞争看,这一事件对基础模型厂商形成了共同压力。OpenAI、Anthropic、Google、Amazon 和 xAI 都在推动更广泛的企业采用,而企业客户越来越要求的不只是“更聪明的模型”,还包括“可验证的安全边界”。在这一点上,模型厂商之间的差异化将越来越多体现在安全评测、红队测试、审计工具、企业控制台和合规支持上,而不仅是基准分数。

受益者可能包括三类参与者:

1. AI安全与评测工具提供商:帮助企业把单轮测试扩展到多轮、代理式和任务链式评估。 2. 云与平台型厂商:如果它们能把安全监控、权限控制和日志审计原生集成到模型服务中,将更容易成为企业默认选择。 3. 合规与治理服务提供商:当监管机构开始更关注“真实攻击面”而不是静态benchmark时,企业对第三方治理能力的需求会增加。

承压者则是那些仍将安全叙事建立在静态基准之上的模型供应商。如果厂商无法说明多轮操控下的风险控制方式,企业采购团队可能会把其视为“可用但未必可控”的选项。

Enterprise Implications

对企业决策者来说,这一研究的直接启示是:AI安全评估不能停留在“模型会不会拒绝危险请求”,而应转向“在完整业务流程里,模型是否会被逐步诱导出不符合预期的行为”。

企业至少需要关注四件事:

  • 采购前评估:要求供应商提供多轮对话、连续任务、角色诱导和上下文重构场景下的测试结果。
  • 部署中控制:限制高风险功能开关,尤其是会改变模型推理与输出策略的配置。
  • 运行时监控:对异常对话路径、反复重试、角色切换和越权请求建立日志与告警机制。
  • 责任划分:明确模型供应商、平台方和企业内部部署团队各自承担的安全责任。

对于正在推进 AI Agent 或自动化工作流的企业,风险还会进一步放大,因为Agent不再只是回答问题,而是会调用工具、访问系统并执行动作。多轮对话中的一次策略偏移,可能在代理链条中演变成实际业务后果。

Outlook

12个月内 企业会更频繁地要求供应商提交多轮对话安全测试与红队结果,单轮benchmark的说服力将继续下降。AI安全预算将更多流向评测、监控和权限治理。

24个月内 大模型厂商可能把“多轮安全性”作为企业版产品的差异化卖点之一,安全能力将更深地嵌入控制台、审计和策略管理层。围绕AI治理的第三方工具生态有望扩大。

3年内 监管和采购标准可能进一步转向真实使用场景测试,而不是仅看静态评分。对于企业来说,AI治理将从项目制要求变成持续运营能力;对于模型厂商来说,安全与可控性将越来越像基础设施能力,而不只是合规附加项。

结论

Cisco这项研究传递出的核心信号是:企业在评估大模型风险时,正在面对一个比“模型是否回答危险问题”更复杂的问题——模型在连续交互中能否保持边界稳定。当AI从聊天工具走向业务执行层,这一问题不再是安全团队的边缘议题,而是企业AI商业化能否规模化落地的核心约束之一。

文章语境 · aiindustryreview

aiindustryreview 将这段说明放在「AI 模型 / 跟踪前沿模型发布、基准表现、安全评估、开放权重模型、多模态系统,以及买方真正关心的能力变化。 / 模型发布与能力声明」的站点语境中。「AI 模型 / 跟踪前沿模型发布、基准表现、安全评估、开放权重模型、多模态系统,以及买方真正关心的能力变化。 / 模型发布与能力声明」解释了本文的本地编辑角度;日期、名称和状态变化仍需重新核对。读者复用摘要前应先打开来源链接。

来源链接

  1. https://www.infosecurity-magazine.com/news/all-major-llms-exposed-to-multi/主要

相关文章

返回频道