中文

寻找多智能体强 Pareto 最优策略之路

机器学习 2024-10-28 v1

摘要

本 work 研究了在具有合作奖励结构的多智能体强化学习问题中寻找 Pareto 最优策略的问题。我们指出,任何每智能体仅优化其自身奖励的算法都可能收敛到亚最优解。因此,要实现 Pareto 最优,智能体必须通过考虑他人奖励来行事。这一观察将多目标优化框架与多智能体强化学习联系起来。我们首先提出了一种用于在多智能体环境中应用多梯度下降算法 (MGDA) 的框架。我们进一步指出,标准 MGDA 受限于弱 Pareto 收敛,这一问题虽在其他学习环境中常被忽视,但在多智能体强化学习中十分常见。为缓解此问题,我们提出了 MGDA++,对现有算法进行改进以正确处理 MGDA 的弱最优收敛。理论上,我们证明了 MGDA++ 在凸、光滑的二目标问题中收敛到强 Pareto 最优解。我们进一步在 Gridworld 基准中展示了 MGDA++ 的优势。结果表明,我们提出的方法能够高效收敛,并在收敛策略的优化性方面优于其他方法。源代码已公开于 \url{https://github.com/giangbang/Strong-Pareto-MARL}。

关键词

引用

@article{arxiv.2410.19372,
  title  = {Toward Finding Strong Pareto Optimal Policies in Multi-Agent Reinforcement Learning},
  author = {Bang Giang Le and Viet Cuong Ta},
  journal= {arXiv preprint arXiv:2410.19372},
  year   = {2024}
}

备注

Submitted to ACML 2024 Special Issue Journal track