中文

POWQMIX:面向协作多智能体强化学习的具有潜在最优联合动作识别的加权值分解

机器学习 2025-04-11 v5 人工智能

摘要

值函数分解方法常用于协作多智能体强化学习中,其中 QMIX 受到了广泛关注。许多基于 QMIX 的方法在联合动作值和个体动作值之间引入单调性约束以实现分散式执行。然而,此类约束限制了值分解的表示能力,限制了其能表示的联合动作值,并阻碍了最优策略的学习。为了应对这一挑战,我们提出了潜在最优联合动作加权 QMIX(POWQMIX)算法,该算法识别潜在最优的联合动作,并在训练期间为这些联合动作对应的损失分配更高的权重。我们从理论上证明,通过这种加权训练方法可以保证恢复最优策略。在矩阵博弈、难度增强的捕食者-猎物以及 StarCraft II 多智能体挑战环境中的实验表明,我们的算法优于基于值的最先进的多智能体强化学习方法。

关键词

引用

@article{arxiv.2405.08036,
  title  = {POWQMIX: Weighted Value Factorization with Potentially Optimal Joint Actions Recognition for Cooperative Multi-Agent Reinforcement Learning},
  author = {Chang Huang and Shatong Zhu and Junqiao Zhao and Hongtu Zhou and Chen Ye and Tiantian Feng and Changjun Jiang},
  journal= {arXiv preprint arXiv:2405.08036},
  year   = {2025}
}

备注

This paper needs further refinement