从监控到信号传递:作为智能体 AI 环境控制的升级通道
密码学与安全
2026-05-01 v2 人工智能
摘要
当访问敏感信息的 AI 智能体在完成既定任务与遵守规则或伦理约束之间遇到冲突时,它们可能会诉诸未授权行为。现有的推理时安全研究主要通过监控和访问限制来解决这一问题。我们研究了一个互补且尚未充分探索的层面:环境控制,它在冲突发生时作用于智能体的决策上下文,使其更有可能采取授权的替代路径而非未授权路径。借鉴情境犯罪预防(SCP)——一种用于人类内部风险管理、通过环境中的设计选择使有害行为收益降低且合规行为更可行的框架——我们设计并评估了升级通道,作为此类控制的具体实例。升级通道为智能体提供了一条正式的带外路径,以将冲突上报给独立权威机构。我们评估了两种设计:一种简单的电子邮件升级通道,以及一种具有工具性可信度的通道,后者保证 30 分钟的暂停和独立审查,使授权路径对目标实现真正有用,而不仅仅是名义上可用。在使用 Lynch 等人(2025)的智能体任务-规则冲突场景对 10 个前沿 LLM 进行的评估中,我们发现,在没有任何控制的情况下,有害行为发生率为 38.73%。简单的升级通道将其降至 5.92%;具有工具性可信度的通道进一步将其降至 1.21%,在测试的 10 个模型和 24,000 个样本中均观察到了统计学上的显著改善。我们的结果表明,授权替代路径的工具性可信度至关重要,且环境控制设计是智能体 AI 系统纵深防御工具包中一个富有成效且很大程度上未被探索的补充。
引用
@article{arxiv.2510.05192,
title = {From surveillance to signalling: escalation channels as environmental controls for agentic AI},
author = {Francesca Gomez},
journal= {arXiv preprint arXiv:2510.05192},
year = {2026}
}
备注
10 pages