中文

强化学习中的动量

机器学习 2020-04-01 v2 机器学习

摘要

我们将优化中的动量概念适配到强化学习。将状态-动作值函数视为优化中梯度的类比,我们把动量解释为连续 qq-函数的平均。我们推导出动量值迭代(Momentum Value Iteration, MoVI),这是融入该动量思想的值迭代变体。我们的分析表明,这使 MoVI 能对各次迭代的误差取平均。我们展示了所提方法可轻松扩展到深度学习。具体地,我们基于 MoVI 对 DQN 提出简单改进,并在 Atari 游戏上进行了实验。

关键词

引用

@article{arxiv.1910.09322,
  title  = {Momentum in Reinforcement Learning},
  author = {Nino Vieillard and Bruno Scherrer and Olivier Pietquin and Matthieu Geist},
  journal= {arXiv preprint arXiv:1910.09322},
  year   = {2020}
}

备注

AISTATS 2020