中文

神经复制动力学

机器学习 2020-03-02 v5 人工智能 机器学习

摘要

策略梯度与 actor-critic 算法构成了深度强化学习中许多常用训练技术的基础。在多智能体环境中使用这些算法会带来非平稳性与不稳定性等问题。本文中,我们首先证明标准的基于 softmax 的策略梯度即使在最温和的非平稳性下也容易出现糟糕的性能。相比之下,众所周知复制动力学(一种来自演化博弈论的被充分研究的模型)会消除被占优策略,并在零和博弈中展现时间平均轨迹到内部纳什均衡的收敛。因此,以复制动力学为基础,我们推导了对策略梯度方法优雅的一行改动,简单地绕过经 softmax 的梯度步,得到名为神经复制动力学(NeuRD)的新算法。在单状态全动作情形下,NeuRD 退化为指数权重/Hedge 算法。此外,NeuRD 与 softmax 反事实后悔最小化具有形式等价性,这保证了在序贯表格情形下的收敛。重要的是,我们的算法提供了一种将复制动力学扩展到函数逼近情形的直接途径。实证结果表明,在 Kuhn 扑克、Leduc 扑克和 Goofspiel 这些标准不完美信息基准上评估时,NeuRD 能快速适应非平稳性,在表格与函数逼近情形下均显著优于策略梯度。

关键词

引用

@article{arxiv.1906.00190,
  title  = {Neural Replicator Dynamics},
  author = {Daniel Hennes and Dustin Morrill and Shayegan Omidshafiei and Remi Munos and Julien Perolat and Marc Lanctot and Audrunas Gruslys and Jean-Baptiste Lespiau and Paavo Parmas and Edgar Duenez-Guzman and Karl Tuyls},
  journal= {arXiv preprint arXiv:1906.00190},
  year   = {2020}
}