多智能体演员-评论家方法下的去中心化 LLM 协作学习
人工智能
2026-05-27 v5 分布式、并行与集群计算
多智能体系统
摘要
近期研究探索了通过多智能体强化学习 (MARL) 优化 LLM 协作方式,但大多数 MARL 微调方法依赖预定义的执行协议,往往需要中心化执行。去中心化 LLM 协作更具实际应用价值,因为智能体可并行运行推理并实现灵活的部署。此外,现有方法使用蒙特卡洛方法进行微调, suffers from high variance,导致需要更多样本才能有效训练。演员-评论家方法在 MARL 中广泛应用于处理此类问题;因此,我们开发了多智能体演员-评论家 (MAAC) 方法以优化去中心化 LLM 协作。本文分析了这些 MAAC 方法何时以及为何有效。我们提出两种 MAAC 方法:一种是带集中化评论家的 CoLLM-CC,另一种是带去中心化评论家的 CoLLM-DC。我们的实验覆盖写作、编码和游戏等领域,表明蒙特卡洛方法和 CoLLM-DC 在短时段且奖励稠密的场景中可与 CoLLM-CC 相当。然而,在长时段或稀疏奖励任务中,两者都落后于 CoLLM-CC,其中蒙特卡洛方法需要大量样本,CoLLM-DC 难以收敛。
引用
@article{arxiv.2601.21972,
title = {Learning Decentralized LLM Collaboration with Multi-Agent Actor Critic},
author = {Shuo Liu and Tianle Chen and Ryan Amiri and Christopher Amato},
journal= {arXiv preprint arXiv:2601.21972},
year = {2026}
}