中文

ReMIX:多智能体强化学习中单调值函数分解的遗憾最小化

机器学习 2023-02-14 v1

摘要

值函数分解方法已成为集中训练与分散执行范式下协作多智能体强化学习的主导方法。通过使用智能体效用的单调混合函数对最优联合动作值函数进行分解,这些算法确保了分散决策时联合与局部动作选择之间的一致性。然而,单调混合函数的使用也带来了表示能力的局限。将无限制混合函数最优投影到单调函数类上仍是一个开放问题。为此,我们提出 ReMIX,将该值函数分解的最优投影问题表述为对不同状态-动作值投影权重的遗憾最小化。此类优化问题可松弛并利用拉格朗日乘子法求解,得到闭式最优投影权重。通过最小化由此产生的策略遗憾,我们缩小了最优与受限单调混合函数之间的差距,从而获得改进的单调值函数分解。我们在 Predator-Prey 与 StarCraft Multiagent Challenge 环境中的实验结果证明了我们方法的有效性,表明其更好地处理了具有非单调值函数的环境。

关键词

引用

@article{arxiv.2302.05593,
  title  = {ReMIX: Regret Minimization for Monotonic Value Function Factorization in Multiagent Reinforcement Learning},
  author = {Yongsheng Mei and Hanhan Zhou and Tian Lan},
  journal= {arXiv preprint arXiv:2302.05593},
  year   = {2023}
}