PropGuard:通过传播感知探索与纠正保障 LLM-MAS 安全
机器学习
2026-05-19 v1 人工智能
密码学与安全
摘要
LLM 多智能体系统(LLM-MAS)因角色专化、工具使用、记忆和协作推理等因素,已成为解决复杂任务的有前景的范式。然而,这些交互创造了新的安全风险,恶意指令通过消息、工具或记忆等方式在智能体之间和轮次间传播,可能导致系统级被破坏。现有防御措施主要依赖本地过滤或基于图的异常检测,但往往无法追踪细粒度的传播路径,或在不干扰良好协作的前提下纠正受污染的状态。我们提出了 PropGuard,一个面向保障 LLM-MAS 的传播感知框架。PropGuard 构建了一种双视图时空图,结合响应导向的风险估计与完整状态证据保存。基于这些风险先验,经过 GE-GRPO 训练的检查器依次探索完整状态图,以恢复紧凑的可疑传播子图。PropGuard 通过子图感知诊断验证有害传播,并应用源导向纠正以纠正上游污染并回放受影响的下游交互。在四种通信架构和五种攻击设置的实验中,PropGuard 持续降低攻击成功率,同时保持高任务级防御成功率,实现了良好的效果-效率权衡。
关键词
引用
@article{arxiv.2605.16346,
title = {PropGuard: Safeguarding LLM-MAS via Propagation-Aware Exploration and Remediation},
author = {Bingyu Yan and Xiaoming Zhang and Jinyu Hou and Chaozhuo Li and Ziyi Zhou and Xiaozhe Zhang and Litian Zhang},
journal= {arXiv preprint arXiv:2605.16346},
year = {2026}
}