中文

LITMUS:在真实OS环境中评估LLM代理行为越狱的基准

密码学与安全 2026-05-12 v1 计算与语言

摘要

LLM基于的自主代理在真实操作系统环境中的快速传播引入了一种新的安全风险类别:行为越狱,即攻击者诱导代理执行具有不可逆后果的危险OS级操作。现有基准要么仅在语义层面评估安全性,忽略物理层面的伤害,要么无法隔离测试用例,让早期运行 contaminate 后续运行。我们提出LITMUS(LLM-agents In-OS Testing for Measuring Unsafe Subversion),通过语义-物理双重验证机制和OS级状态回滚来解决上述两个问题。LITMUS包含819个高风险测试用例,分为一个有害seed子集和六个覆盖三种对抗范式(越狱说话、技能注入和实体包装)的攻击扩展子集,以及一个完全自动化的多代理评估框架,在对话和OS级物理层面对行为进行判断。跨前沿代理的评估揭示了三个发现:(1)当前代理缺乏有效的安全意识,强模型(如Claude Sonnet 4.6)仍会执行40.64%的高风险操作;(2)代理普遍存在执行幻觉(EH),即语言上拒绝请求而系统级 dangerous operation 已完成,对话和OS级物理层面的任何先前语义-only框架都无法察觉;(3)技能注入和实体包装攻击实现了高成功率,暴露了代理的显著脆弱性。LITMUS提供了用于可重复、以物理为基础的LLM代理在真实OS环境中行为安全评估的第一个标准化平台。

关键词

引用

@article{arxiv.2605.10779,
  title  = {LITMUS: Benchmarking Behavioral Jailbreaks of LLM Agents in Real OS Environments},
  author = {Chiyu Zhang and Huiqin Yang and Bendong Jiang and Xiaolei Zhang and Yiran Zhao and Ruyi Chen and Lu Zhou and Xiaogang Xu and Jiafei Wu and Liming Fang and Zhe Liu},
  journal= {arXiv preprint arXiv:2605.10779},
  year   = {2026}
}