中文

当智能体叛变:基于激活的多智能体系统恶意行为检测

密码学与安全 2026-07-07 v1 人工智能

摘要

基于LLM的多智能体系统(MAS)在实现复杂任务有效协作的同时,也面临着由于智能体和交互层面的漏洞而产生的严重安全挑战。现有的大多数MAS安全防御建立在两个核心假设之上:语义明确的恶意攻击和基于图的MAS拓扑及智能体级交互的显式建模。在实践中,现实世界的攻击正变得越来越语义隐蔽,而MAS执行通常是异步的,没有图基传播模型所假设的时间对齐。为解决这些局限性,我们提出了AcMAS,一个基于激活的MAS恶意行为检测框架。通过分析本地智能体激活空间中的内部推理状态,AcMAS能够以对同步鲁棒的方式检测即使是隐蔽的攻击,而无需依赖显式的交互图。此外,我们的激活分析提供了关键信号,指导AcMAS恢复受损智能体的功能,而不是像最先进方法常用的破坏性智能体隔离。综合评估表明,AcMAS在对抗隐蔽攻击方面显著优于基于图的基线,在同步设置中F1分数提高+0.22(0.94 vs. 0.72),在异步设置中提高+0.55(0.93 vs. 0.38),并且能够泛化到不同的开源LLM骨干、攻击强度和MAS规模。

关键词

引用

@article{arxiv.2607.06807,
  title  = {When Agents Go Rogue: Activation-Based Detection of Malicious Behaviors in Multi-Agent Systems},
  author = {Haowen Xu and Xue Tan and Lei Ma and Zhihao Zhang and Chao Wang and Qingze Wang and Ping Chen and Jun Dai and Xiaoyan Sun},
  journal= {arXiv preprint arXiv:2607.06807},
  year   = {2026}
}

备注

Accepted to ICML 2026