多智能体系统中针对控制流劫持攻击的防御破解与修复
量子物理
2026-01-09 v2
摘要
控制流劫持攻击会操纵多智能体系统的编排机制,使其执行不安全动作并泄露敏感信息。近期防御方案如LlamaFirewall,依赖于对智能体间通信的对齐检查,以确保所有智能体调用“相关且可能进一步实现”原始目标。我们首先展示了即便采用先进 LLM 进行对齐检查,仍能规避这些防御的控制流劫持攻击。我们认为,多智能体系统的安全目标与功能目标根本存在冲突,这种冲突因“对齐”定义的脆弱性以及检查器对执行上下文的不完整可见性而加剧。随后,我们提出、实现并评估了ControlValve——一种新型防御,灵感来自控制流完整性和最小权限原则。ControlValve (1) 生成多智能体系统的许可控制流图,(2) 强制所有执行符合这些图谱及每个智能体调用的上下文规则(以零样本方式生成)。
引用
@article{arxiv.2510.17275,
title = {Long-distance distribution of atom-photon entanglement based on a cavity-free cold atomic ensemble},
author = {Tian-Yu Wang and Ren-Hui Chen and Yan Li and Ze-Hao Shen and Xiao-Song Fan and Zheng-Bang Ju and Tian-Ci Tang and Xia-Wei Li and Jing-Yuan Peng and Zhi-Yuan Zhou and Wei Zhang and Guang-Can Guo and Bao-Sen Shi},
journal= {arXiv preprint arXiv:2510.17275},
year = {2026}
}
备注
v2: Accepted for publication in Physical Review Letters