捕获传播前的感染:多智能体系统中的前瞻引导防御
人工智能
2026-05-15 v3
摘要
大型多模态模型驱动的多智能体系统(MAS)通过专业化智能体实现协作式复杂问题解决。然而,MAS 面临 infectious jailbreak(感染式暴力破解)风险,单个智能体被攻破后可蔓延至其他智能体,导致普遍性失效。现有防御方法通过训练更具传染性的治愈因子,偏向于检索该因子而非病毒性对抗性示例(VirAEs),但这会使智能体响应趋同,仅提供表面性抑制,无法实现真正的恢复。我们重新审视这些防御措施——其操作方式为全局共享治愈因子,而感染式暴力破解源于局部交互行为。这种匹配度不足限制了其有效性。为此,我们提出一种基于前瞻引导的本地净化(Foresight-Guided Local Purification, FLP)框架,该框架无需训练,使每个智能体通过推理未来交互来跟踪行为演化并消除感染。具体而言,每个智能体模拟后续对话轮次中未来行为轨迹。为反映 MAS 中的多样性,我们引入多人格模拟策略,以实现跨交互情境的稳健预测。随后,以响应多样性作为诊断信号,通过分析基于人格的预测在检索结果和语义层面的不一致性来检测感染。对于受感染的智能体,我们应用本地化净化:近期感染通过立即回滚专辑实现缓解,而长期感染则采用递归二进制诊断(Recursive Binary Diagnosis, RBD)进行处理,该方法递归划分图像专辑,并对同一诊断策略进行应用,以局部化和消除 VirAEs。实验表明,FLP 将最大累积感染率从 95% 以上降至 5.47% 以下。此外,检索和语义指标与良性基线紧密匹配,表明有效保留了交互多样性。
引用
@article{arxiv.2605.01758,
title = {Catching the Infection Before It Spreads: Foresight-Guided Defense in Multi-Agent Systems},
author = {Yue Ma and Ziyuan Yang and Yi Zhang},
journal= {arXiv preprint arXiv:2605.01758},
year = {2026}
}
备注
12 pages