中文

评估 LLM 智能体对分层安全原则的遵循:一个用于探测基础可控性组件的轻量级基准

机器学习 2025-07-11 v2 人工智能 计算机与社会

摘要

先进 AI 发展的可信安全计划需要验证智能体行为并尽早发现潜在控制缺陷的方法。一个基本方面是确保智能体遵循安全关键原则,特别是当这些原则与操作目标冲突时。本文引入了一个轻量级、可解释的基准,以评估 LLM 智能体在面对冲突的任务指令时坚持高级安全原则的能力。我们对六个 LLM 的评估揭示了两个主要发现:(1)一种可量化的“合规成本”,即即使存在合规解决方案,安全约束也会降低任务性能;(2)一种“合规错觉”,即高遵循度往往掩盖了任务无能,而不是原则性的选择。这些发现提供了初步证据,表明虽然 LLM 可以受到分层指令的影响,但当前方法缺乏可靠安全治理所需的一致性。

关键词

引用

@article{arxiv.2506.02357,
  title  = {Evaluating LLM Agent Adherence to Hierarchical Safety Principles: A Lightweight Benchmark for Probing Foundational Controllability Components},
  author = {Ram Potham},
  journal= {arXiv preprint arXiv:2506.02357},
  year   = {2025}
}

备注

Preprint. This work has been submitted to the Technical AI Governance Workshop at ICML 2025 for review