通过顺序公共物品游戏激励多 LLM 系统中的战略合作
人工智能
2025-08-05 v1 计算机科学与博弈论
摘要
协调多个大语言模型(LLM)解决复杂任务的合作,面临计算成本与集体性能之间的根本性权衡。我们引入一种新型、基于博弈论的强化学习(RL)框架,即多智能体合作顺序公共物品游戏(MAC-SPGG),系统性地激励多 LLM 集成中的合作。在 MAC-SPGG 中,LLM 智能体按顺序行动,观察前者的输出并更新信念以条件化其贡献。通过重新设计公共物品奖励,务必贡献成为唯一的子游戏完美纳什均衡(SPNE),这消除了传统 SPGG 或 PGG 中的搭便利。在其顺序协议中,用代替昂贵的基于轮次的信息交换,以简化的决策流程削减了通信开销,同时保持了战略深度。我们证明了在现实参数下 SPNE 的存在性和唯一性,经验上表明,MAC-SPGG 训练的集成在单智能体基线、链路思考提示和其他合作方法上都表现更好,甚至在推理、数学、代码生成和 NLP 任务上与大规模模型持平。我们的结果凸显了结构化、激励对齐的 MAC-SPGG 合作在可扩展且稳健的多智能体语言生成中的力量。
引用
@article{arxiv.2508.02076,
title = {Everyone Contributes! Incentivizing Strategic Cooperation in Multi-LLM Systems via Sequential Public Goods Games},
author = {Yunhao Liang and Yuan Qu and Jingyuan Yang and Shaochong Lin and Zuo-Jun Max Shen},
journal= {arXiv preprint arXiv:2508.02076},
year = {2025}
}