个体能否操纵多智能体的集体决策?
计算与语言
2025-10-16 v2 人工智能
摘要
个体大语言模型(LLMs)已在医疗保健和法律等多个领域展现出显著能力。近期研究还表明,协调的多智能体系统通过协作展现出增强的决策和推理能力。然而,由于个体LLM的脆弱性以及访问多智能体系统中所有智能体的难度,一个关键问题随之而来:如果攻击者仅了解一个智能体,他们是否仍能生成足以误导集体决策的对抗样本?为探索此问题,我们将其形式化为一个不完全信息博弈,其中攻击者仅了解一个目标智能体,而缺乏对系统中其他智能体的了解。基于此形式化,我们提出了M-Spoiler框架,该框架模拟多智能体系统内的智能体交互以生成对抗样本。这些样本随后被用于操纵目标系统中的目标智能体,从而误导系统的协作决策过程。更具体地说,M-Spoiler引入了一个顽固智能体,通过模拟目标系统中智能体潜在的顽固响应,主动辅助优化对抗样本。这增强了所生成对抗样本在误导系统方面的有效性。通过在多种任务上的广泛实验,我们的发现证实了在多智能体系统中掌握个体智能体知识所带来的风险,并证明了我们框架的有效性。我们还探索了几种防御机制,结果表明我们提出的攻击框架仍比基线方法更有效,这突显了进一步研究防御策略的必要性。
引用
@article{arxiv.2509.16494,
title = {Can an Individual Manipulate the Collective Decisions of Multi-Agents?},
author = {Fengyuan Liu and Rui Zhao and Shuo Chen and Guohao Li and Philip Torr and Lei Han and Jindong Gu},
journal= {arXiv preprint arXiv:2509.16494},
year = {2025}
}