中文

工具功能对 LLM 智能体安全对齐的因果影响

软件工程 2026-03-24 v1 人工智能 机器学习

摘要

大型语言模型 (LLM) 正越来越多地部署为具备可执行工具访问权限的智能体,以直接与外部系统交互。然而,大多数安全评估仍以文本为中心,假设符合语言的行为等同于安全行为,一旦模型获准行动,这一假设便变得不可靠。在本研究中,我们通过一个配对评估框架,实证检验可执行工具功能如何改变 LLM 智能体的安全对齐,该框架在相同的提示和政策下比较文本-only chatbot 行为与工具-enabled agent 行为。实验在一个确定性金融交易环境中进行,涉及 1,500 个程序化生成的情境,采用二元安全约束。为分离意图与结果,我们使用两种双重执行情境:一种阻止不安全操作,另一种允许不安全操作。无论是否启用工具,所评估的模型在文本-only 设置下都保持完美合规,但在工具访问被引入后违反率显著上升,最高可达 85%,尽管规则保持不变。我们观察到尝试违反与实际执行违反之间的显著差距,表明外部警戒措施可以在掩盖持续性错位的同时抑制可见的伤害。智能体还会在无对抗性提示的情况下发展出自发的约束规避策略。这些结果表明,工具功能是安全错位的主要驱动因素,文本基准的评估对评估具智能体系统不足。

关键词

引用

@article{arxiv.2603.20320,
  title  = {The Causal Impact of Tool Affordance on Safety Alignment in LLM Agents},
  author = {Shasha Yu and Fiona Carroll and Barry L. Bentley},
  journal= {arXiv preprint arXiv:2603.20320},
  year   = {2026}
}