G-Safeguard:面向基于 LLM 的多智能体系统的拓扑引导安全透镜与治理方法
密码学与安全
2025-02-18 v1 机器学习
多智能体系统
摘要
基于大语言模型(LLM)的多智能体系统(MAS)在各种复杂任务中展现了显著能力,从协作问题求解到自主决策。然而,随着这些系统越来越多地集成到关键应用中,其对对抗攻击、虚假信息传播和非预期行为的脆弱性引发了重大关注。为应对这一挑战,我们提出了 G-Safeguard,一种面向鲁棒 LLM-MAS 的拓扑引导安全透镜与治理方法,利用图神经网络检测多智能体话语图中的异常,并采用拓扑干预进行攻击修复。大量实验表明,G-Safeguard:(I)在各种攻击策略下表现出显著有效性,恢复了超过 40% 的提示注入性能;(II)高度适应不同的 LLM 主干和大规模 MAS;(III)可与主流 MAS 无缝结合并提供安全保证。代码地址:https://github.com/wslong20/G-safeguard
引用
@article{arxiv.2502.11127,
title = {G-Safeguard: A Topology-Guided Security Lens and Treatment on LLM-based Multi-agent Systems},
author = {Shilong Wang and Guibin Zhang and Miao Yu and Guancheng Wan and Fanci Meng and Chongye Guo and Kun Wang and Yang Wang},
journal= {arXiv preprint arXiv:2502.11127},
year = {2025}
}