中文

团队语言:LLM 指导下的多智能体强化学习信用分配

多智能体系统 2025-03-04 v2

摘要

在多智能体强化学习 (MARL) 中,信用分配——即将成功或失败归因于单个智能体贡献——始终是一个根本性挑战,尤其是在稀疏奖励环境中。常用方法如价值分解在这些环境中常导致次优策略,同时设计符合人类直觉的稠密奖励函数又复杂且代价高昂。本文提出了一种新框架,其中大型语言模型 (LLM) 基于任务自然语言描述和整体团队目标生成智能体特定的稠密奖励。通过在多个查询上学习基于潜在的奖励函数,我们的方法在保持 LLM 评估每个智能体对整体任务贡献的同时,减少排名误差的影响。通过大量实验,我们展示了该方法在收敛速度和策略回报方面优于最先进的 MARL 基线。

关键词

引用

@article{arxiv.2502.03723,
  title  = {Speaking the Language of Teamwork: LLM-Guided Credit Assignment in Multi-Agent Reinforcement Learning},
  author = {Muhan Lin and Shuyang Shi and Yue Guo and Vaishnav Tadiparthi and Behdad Chalaki and Ehsan Moradi Pari and Simon Stepputtis and Woojun Kim and Joseph Campbell and Katia Sycara},
  journal= {arXiv preprint arXiv:2502.03723},
  year   = {2025}
}

备注

11 pages, 6 figures. Added the acknowledgement section