中文

谁拥有此智能体?追溯 AI 智能体至其所有者

密码学与安全 2026-05-18 v1 人工智能 多智能体系统

摘要

AI 智能体越来越多地被部署以在世界上自主行动,但目前仍没有可靠的方法将一个有害的智能体追溯到部署它的账户。这在意图谱系的两端都造成了相同的问责缺口:良性操作者可能部署配置错误或权限过宽的智能体,无意中造成伤害;而恶意操作者则可能故意将智能体武器化,用于诈骗、骚扰或网络攻击。在许多情况下,这些智能体由供应商托管的模型驱动,即使是进行网络行动的国家级行为者等复杂对手也依赖于此。无论哪种情况,受影响方可以观察到行为,但无法通知负责的操作者、停止会话或识别账户以进行调查。我们将此缺口形式化为智能体归因问题:将观察到的智能体交互链接到托管供应商处的负责账户。据我们所知,这是首个定义该问题并提出实用解决方案的工作。我们的协议基于金丝雀:授权方向智能体的交互流中注入一个金丝雀,供应商搜索一个狭窄的会话日志窗口以恢复原始会话和账户。在非对抗性环境中,简单的金丝雀就足够了。对于过滤或改写传入内容的对抗性操作者,我们开发了鲁棒的金丝雀构造,这些构造无法在不降低智能体自身任务性能的情况下被抑制,从而在防御者一方形成了形式化的不对称优势。我们评估了包括真实世界智能体在内的多种场景,并表明我们的归因方法对于供应商端部署是可靠、鲁棒且可扩展的。

关键词

引用

@article{arxiv.2605.16035,
  title  = {Who Owns This Agent? Tracing AI Agents Back to Their Owners},
  author = {Ruben Chocron and Doron Jonathan Ben Chayim and Eyal Lenga and Gilad Gressel and Alina Oprea and Yisroel Mirsky},
  journal= {arXiv preprint arXiv:2605.16035},
  year   = {2026}
}

备注

Under Review