中文

基于双层图异常检测的 LLM 多主体系统可解释细粒度安全护卫

密码学与安全 2025-12-23 v1 人工智能 多智能体系统

摘要

大型语言模型(LLM)基于的多主体系统(MAS)在解决复杂任务方面展现出强大能力。随着 MAS 在各类安全关键任务中日益自主,检测恶意主体已成为关键安全议题。虽然现有的图异常检测(GAD)防御可识别异常主体,但主要依赖粗粒度的句子级信息,忽略细粒度的词汇线索,导致性能不佳。此外,这些方法缺乏可解释性,限制了其可靠性和实际应用。为此,我们提出 XG-Guard,一个面向 MAS 恶意主体检测的可解释且细粒度安全护卫框架。为融合主体标识和令牌级表征,我们采用双层主体编码器联合建模每个主体的句子级和令牌级表示。主题基准异常检测器进一步捕获 MAS 对话中讨论焦点的演变,而双层得分融合机制量化了令牌级贡献,以提供解释。广泛的实验在多样化的 MAS � 拓扑和攻击情景下验证了 XG-Guard 稳健的检测性能和强大的可解释性。

关键词

引用

@article{arxiv.2512.18733,
  title  = {Explainable and Fine-Grained Safeguarding of LLM Multi-Agent Systems via Bi-Level Graph Anomaly Detection},
  author = {Junjun Pan and Yixin Liu and Rui Miao and Kaize Ding and Yu Zheng and Quoc Viet Hung Nguyen and Alan Wee-Chung Liew and Shirui Pan},
  journal= {arXiv preprint arXiv:2512.18733},
  year   = {2025}
}

备注

14 pages, 3 tables, 5 figures