中文

基于贪婪边际贡献计算的自适应价值分解用于合作多智能体强化学习

机器人学 2023-02-15 v1 人工智能 多智能体系统

摘要

现实世界中的合作通常要求智能体之间同时进行密集的协调。该任务已在合作多智能体强化学习(MARL)框架下被广泛研究,而价值分解方法是其中的前沿解决方案之一。然而,传统方法将价值函数学习为每个智能体效用的单调混合,无法解决具有非单调回报的任务,这阻碍了它们在通用场景中的应用。近期方法从隐式信用分配的角度出发,通过学习具有完全表达能力的价值函数或利用额外结构来改善合作来应对该问题。然而,它们要么因联合动作空间过大而难以学习,要么不足以捕捉智能体间对解决非单调回报任务至关重要的复杂交互。为解决这些问题,我们提出一种新颖的显式信用分配方法来处理非单调问题。我们的方法,即基于贪婪边际贡献的自适应价值分解(AVGM),建立在自适应价值分解之上,该分解学习动态变化智能体组的合作价值。我们首先阐明所提出的值分解能够考虑智能体间的复杂交互,并且可在大规模场景中可行地学习。接着,我们的方法使用从值分解中计算出的贪婪边际贡献作为个体信用,以激励智能体学习最优合作策略。我们进一步用动作编码器扩展该模块,以保证计算贪婪边际贡献的线性时间复杂度。实验结果表明,我们的方法在多个非单调域中取得了显著的性能提升。

关键词

引用

@article{arxiv.2302.06872,
  title  = {Adaptive Value Decomposition with Greedy Marginal Contribution Computation for Cooperative Multi-Agent Reinforcement Learning},
  author = {Shanqi Liu and Yujing Hu and Runze Wu and Dong Xing and Yu Xiong and Changjie Fan and Kun Kuang and Yong Liu},
  journal= {arXiv preprint arXiv:2302.06872},
  year   = {2023}
}

备注

This paper is accepted by aamas 2023