强化学习中的动量
机器学习
2020-04-01 v2 机器学习
摘要
我们将优化中的动量概念适配到强化学习。将状态-动作值函数视为优化中梯度的类比,我们把动量解释为连续 -函数的平均。我们推导出动量值迭代(Momentum Value Iteration, MoVI),这是融入该动量思想的值迭代变体。我们的分析表明,这使 MoVI 能对各次迭代的误差取平均。我们展示了所提方法可轻松扩展到深度学习。具体地,我们基于 MoVI 对 DQN 提出简单改进,并在 Atari 游戏上进行了实验。
引用
@article{arxiv.1910.09322,
title = {Momentum in Reinforcement Learning},
author = {Nino Vieillard and Bruno Scherrer and Olivier Pietquin and Matthieu Geist},
journal= {arXiv preprint arXiv:1910.09322},
year = {2020}
}
备注
AISTATS 2020