中文

攻击消息而非代理: 针对 LLM-MAS 的多轮自适应隐形篡改框架 MAST

密码学与安全 2025-08-06 v1 人工智能 多智能体系统

摘要

大型语言模型多代理系统 (LLM-MAS) 通过代理间通信有效完成复杂动态任务, 但这种依赖引入了显著安全漏洞。现有攻击方法要么针对代理内部结构, 要么依赖直接显性的劝说, 限制了其有效性、适应性与隐形性。本文提出 MAST (Multi-round Adaptive Stealthy Tampering), 一个针对系统通信漏洞设计的多轮自适应隐形篡改框架。MAST 将蒙特卡洛树搜索与直接偏好优化相结合, 训练攻击策略模型以生成有效的多轮篡改策略。为保持隐形性, 我们在篡改过程中施加语义相似性与嵌入相似性的双重约束。广泛实验表明, 在多样化任务、通信架构与 LLM 环境下, MAST 均实现高攻击成功率, 并显著提升隐形性。这些发现凸显了 MAST 在有效性、隐形性与适应性方面的优势, 凸显了 LLM-MAS 通信层面需构建鲁棒防御的必要性。

关键词

引用

@article{arxiv.2508.03125,
  title  = {Attack the Messages, Not the Agents: A Multi-round Adaptive Stealthy Tampering Framework for LLM-MAS},
  author = {Bingyu Yan and Ziyi Zhou and Xiaoming Zhang and Chaozhuo Li and Ruilin Zeng and Yirui Qi and Tianbo Wang and Litian Zhang},
  journal= {arXiv preprint arXiv:2508.03125},
  year   = {2025}
}