中文

凹效用强化学习:平均场博弈视角

机器学习 2022-02-17 v4 多智能体系统

摘要

凹效用强化学习(Concave Utility Reinforcement Learning, CURL)将 RL 从智能体策略诱导的占据测度上的线性效用扩展至凹效用。这不仅涵盖 RL,还包括模仿学习和探索等。然而,这一更一般的范式使经典 Bellman 方程失效,并需要新算法。平均场博弈(Mean-field Games, MFGs)是多智能体 RL 的连续近似。它们考虑连续分布的相同智能体的极限情形,这些智能体匿名且具有对称利益,并将问题简化为研究一个与全体种群交互的单一代表性智能体。我们的核心贡献在于表明 CURL 是 MFG 的一个子类。我们认为这对于联结两个社群十分重要。它也得以阐明两个领域的各个方面:我们展示了 CURL 中的凹性与相关 MFG 中的单调性之间的等价性、CURL 中最优条件与 MFG 中纳什均衡之间的等价性,或此类 MFG 的虚拟博弈(Fictitious Play, FP) simply 就是 Frank-Wolfe,从而为 MFG 的离散时间 FP 带来首个收敛速率。我们还通过实验证明,使用最近提出的用于求解 MFG 的算法,我们可以更高效地解决 CURL 问题。

关键词

引用

@article{arxiv.2106.03787,
  title  = {Concave Utility Reinforcement Learning: the Mean-Field Game Viewpoint},
  author = {Matthieu Geist and Julien Pérolat and Mathieu Laurière and Romuald Elie and Sarah Perrin and Olivier Bachem and Rémi Munos and Olivier Pietquin},
  journal= {arXiv preprint arXiv:2106.03787},
  year   = {2022}
}

备注

AAMAS 2022