中文

位置论文:代理 AI 的安全与公平性取决于交互拓扑,而非模型规模或对齐

人工智能 2026-05-05 v1

摘要

随着大型语言模型被越来越多地部署为高风险决策中相互作用的智能体,AI 安全社区假设模型的安全属性会组合成安全的多智能体行为。这一论文提出,这一假设根本错误。在 agentic AI 中,安全性由交互拓扑决定,而非模型权重。当智能体依次 deliberation 或通过平行投票聚合时,信息流和决策耦合的结构主导结果。跨模型家族和规模的证据揭示了三种持久的由拓扑驱动的病态:排序不稳定性,即系统行为主要取决于智能体序列;信息级联,即早期判断会传播 regardless of 正确性;功能坍塌,即系统在满足公平性指标的同时,放弃了有意义的风险判别。与直觉相反,扩大到更有能力的模型会加剧这些效应,因为它增加了共识形成并减少了初始决定的挑战。这些失效模式对模型中心的评估和对齐程序是不可见的。我们认为,agentic AI 必须被视为一个动力系统,而不是一组对齐的组件。交互拓扑必须成为 AI 安全评估和监管的主要目标,要求系统在部署前表现出对各种体系结构变化的鲁棒性。

关键词

引用

@article{arxiv.2605.01147,
  title  = {Position: Safety and Fairness in Agentic AI Depend on Interaction Topology, Not on Model Scale or Alignment},
  author = {Tanav Singh Bajaj and Nikhil Singh and Karan Anand and Eishkaran Singh},
  journal= {arXiv preprint arXiv:2605.01147},
  year   = {2026}
}

备注

18 pages, 8 figures. Position paper