谁是内鬼?基于LLM的多智能体系统中隐藏意图的恶意智能体建模与检测
多智能体系统
2025-10-07 v2 人工智能
摘要
由大型语言模型驱动的多智能体系统在协作解决问题方面展现了卓越的能力。然而,它们的部署也引入了新的安全风险。现有关于基于LLM的智能体的研究主要考察了单智能体场景,而多智能体系统的安全性在很大程度上仍未得到探索。为了填补这一空白,我们对LLM-MAS中的意图隐藏威胁进行了系统研究。我们设计了四种具有代表性的攻击范式,这些范式在保持高度隐蔽性的同时巧妙地破坏任务完成,并在集中式、分散式和分层式通信结构下进行了评估。实验结果表明,这些攻击具有高度破坏性,并且很容易规避现有的防御机制。为了应对这些威胁,我们提出了AgentXposed,一个受心理学启发的检测框架。AgentXposed借鉴了HEXACO人格模型(该模型通过心理特质维度刻画智能体)和Reid审讯技术(一种用于引出隐藏意图的结构化方法)。通过将渐进式问卷探查与基于行为的智能体间监控相结合,该框架能够在恶意行为实施之前主动识别恶意智能体。在六个数据集上针对我们提出的攻击和两个基线威胁进行的大量实验表明,AgentXposed能够有效检测多种形式的恶意行为,在多种通信设置下均表现出强大的鲁棒性。
引用
@article{arxiv.2507.04724,
title = {Who's the Mole? Modeling and Detecting Intention-Hiding Malicious Agents in LLM-Based Multi-Agent Systems},
author = {Yizhe Xie and Congcong Zhu and Xinyue Zhang and Tianqing Zhu and Dayong Ye and Minghao Wang and Chi Liu},
journal= {arXiv preprint arXiv:2507.04724},
year = {2025}
}