中文

LM 代理人可能忽视自身风险知识

人工智能 2025-08-20 v1

摘要

语言模型(LM)代理人已展现出在自动化实际任务方面的巨大潜力,但在安全关键场景下会引发多样化的严重风险。本文识别了LM代理人风险意识与安全执行能力之间的显著鸿沟:尽管他们常对诸如 "Is executing `sudo rm -rf /*' dangerous?" 等查询回答 "Yes",但在实例化轨迹中可能无法识别此类风险,甚至直接执行此类风险操作。为系统性地调查此问题,我们构建了全面的评估框架,考察代理人在三个逐步提升的维度上的安全性:1)其关于潜在风险的知识,2)其在执行轨迹中识别对应风险的能力,3)其实际行为以避免执行此类风险操作的能力。我们的评估结果揭示了两个关键性能差距,类似于LM中所见的生成器-验证器差距:尽管代理人显示出近乎完美的风险知识(>98%通过率),但在实际情境中识别风险的能力显著下降(性能下降>23%),且常常仍执行风险操作(<26%通过率)。值得注意的是,这一趋势在更强大的LM以及专门的推理模型(如 DeepSeek-R1)中同样存在,表明仅靠扩大模型能力或推理计算量并不能本质解决安全问题。我们利用这些观察到的差距开发了风险验证器,独立地批评性地评估代理人提出的行动,同时通过抽象化器将具体执行轨迹转换为抽象描述,使LM能够更有效地识别风险。我们整体系统通过Vanilla-prompted代理人实现了风险行动执行减少55.3%。

关键词

引用

@article{arxiv.2508.13465,
  title  = {LM Agents May Fail to Act on Their Own Risk Knowledge},
  author = {Yuzhi Tang and Tianxiao Li and Elizabeth Li and Chris J. Maddison and Honghua Dong and Yangjun Ruan},
  journal= {arXiv preprint arXiv:2508.13465},
  year   = {2025}
}