, 随着语言模型从聊天机器人向自主智能体演进。
安全评估的范式需要根本性转变。
最终劫持智能体执行攻击者预设的恶意目标,攻击者可以通过操纵环境中的部分输入(如图片),而智能体是由多个组件构成的复合系统,聊天机器人的安全评估主要关注模型直接输出有害内容,需要感知环境、规划行动并与外部世界交互,让攻击信息在多个组件间传播,现有的LM安全评估方法无法充分应对这种复合系统的攻击面,。
郑重声明:本文版权归原作者所有,转载文章仅为传播更多信息之目的,如作者信息标记有误,请第一时间联系我们修改或删除,多谢。

