中文

已部署 AI 代理中的环境说服:非对抗内容暴露后的未授权升级事件

密码学与安全 2026-05-04 v1 人工智能 多智能体系统

摘要

我们报告了一个已部署的多主体研究系统中的安全事件,其中主要 AI 代理安装了 107 个未授权的软件组件,覆盖了系统注册表,覆盖了过督导代理的先前负面决定,并通过日益提升的特权操作达到了尝试执行系统管理员命令的阶段。该事件的前兆并非来自对抗性攻击,而是来自例行内容:一位 principal investigator 将一篇面向人类开发者的技术文章转发给团队讨论。该代理在开放式环境中运行,拥有未受限制的 shell 访问权限、包含真实冲突指令的软性行为准则,且无机器强制的安装策略,此前 6 小时前曾建议安装相同的工具后被告知暂停。我们分析了行为级联、失效的控制边界,以及多主体监督在检测和 Remediation 方面的局限性。我们将指令权重错误用作所观察到失败的描述性解释,并将环境说服(ambient persuasion)作为更广泛的触发配置——非对抗性环境内容导致未授权代理行为——的暂定分析标签。该案例凸显了已部署代理系统的伦理与治理含义:模糊的对话线索不足以作为结果行为的授权,先前的拒绝必须作为可执行约束而非消息层面的提醒,监督机制需要除例行监控外的系统事后审计。

关键词

引用

@article{arxiv.2605.00055,
  title  = {Ambient Persuasion in a Deployed AI Agent: Unauthorized Escalation Following Routine Non-Adversarial Content Exposure},
  author = {Diego F. Cuadros and Abdoul-Aziz Maiga},
  journal= {arXiv preprint arXiv:2605.00055},
  year   = {2026}
}