叛变的微妙艺术:理解基于 LLM 的多智能体系统中的不合作行为
多智能体系统
2026-01-13 v2 计算与语言
摘要
本文引入了一个新框架,用于模拟和分析不合作行为如何 destabilize 或 崩溃 基于 LLM 的多智能体系统。我们的框架包括两个关键组件:(1) 基于博弈论的不合作行为分类学,填补了现有文献中的一个显著空白;(2) 动态生成和细化不合作行为的结构化、多阶段仿真管道,随着智能体状态的演变而演进。我们通过协作资源管理场景评估了该框架,使用诸如生存时间和资源超用率等指标衡量系统稳定性。经验上,我们的框架在生成真实不合作行为方面实现了 96.7% 的准确率,经人类评估验证。我们的结果揭示了 striking 的对比:合作智能体保持完美的系统稳定性(12 轮中 100% 生存,0% 资源超用),而任何不合作行为都可能在 1 到 7 轮内引发快速系统崩溃。我们还评估了基于 LLM 的防御方法,发现它们能够检测部分不合作行为,但一些行为基本无法被检测。这些差距凸显了不合作智能体如何降低集体结果的影响,以及需要构建更具韧性的多智能体系统的重要性。
引用
@article{arxiv.2511.15862,
title = {The Subtle Art of Defection: Understanding Uncooperative Behaviors in LLM based Multi-Agent Systems},
author = {Devang Kulshreshtha and Wanyu Du and Raghav Jain and Srikanth Doss and Hang Su and Sandesh Swamy and Yanjun Qi},
journal= {arXiv preprint arXiv:2511.15862},
year = {2026}
}