时间:2026-08-09 19:42 | 来源:墨客学术 | 作者:墨客学术 | 点击:次
随着语言模型从聊天机器人向自主智能体演进,安全评估的范式需要根本性转变。聊天机器人的安全评估主要关注模型直接输出有害内容,而智能体是由多个组件构成的复合系统,需要感知环境、规划行动并与外部世界交互。攻击者可以通过操纵环境中的部分输入(如图片),让攻击信息在多个组件间传播,最终“劫持”智能体执行攻击者预设的恶意目标。现有的LM安全评估方法无法充分应对这种复合系统的攻击面。