中文

ACIArena:面向智能体级联注入的统一评估

人工智能 2026-04-10 v1 计算与语言 密码学与安全

摘要

协作和信息共享使多智能体系统(MAS)得以实现,但也引入了称为智能体级联注入(Agent Cascading Injection, ACI)的关键安全风险。在此类攻击中,被破坏的智能体利用智能体间的信任来传播恶意指令,导致系统范围的连锁失效。然而,现有研究仅考虑有限的攻击策略和简化的MAS设置,限制了其可泛化性和全面评估。为弥合这一差距,我们引入ACIArena——一个用于评估MAS鲁性的统一框架。ACIArena提供了遍及多个攻击面(即外部输入、智能体轮廓、智能体间消息)和攻击目标(即指令劫持、任务 disruption、信息窃取)的系统评估套件。具体而言,ACIArena建立了统一规范,同时支持MAS构建和攻击防御模块。它覆盖六种常用MAS实现,提供1,356个测试案例用于系统性评估MAS鲁性。我们的基准结果表明,仅通过拓扑结构评估MAS鲁性是不够的;鲁性MAS需要精心设计的角色和受控的交互模式。此外,简化环境中开发的防御措施往往难以迁移到真实环境;狭隘的防御甚至可能引入新漏洞。ACIArena旨�为深入探索MAS设计原则提供坚实基础。

关键词

引用

@article{arxiv.2604.07775,
  title  = {ACIArena: Toward Unified Evaluation for Agent Cascading Injection},
  author = {Hengyu An and Minxi Li and Jinghuai Zhang and Naen Xu and Chunyi Zhou and Changjiang Li and Xiaogang Xu and Tianyu Du and Shouling Ji},
  journal= {arXiv preprint arXiv:2604.07775},
  year   = {2026}
}

备注

ACL 2026