中文

平均DQN:深度强化学习的方差缩减与稳定化

人工智能 2017-03-13 v4 机器学习 机器学习

摘要

深度强化学习(DRL)算法的非稳定性和变异性往往会对其性能产生不利影响。平均DQN是对DQN算法的一种简单扩展,基于对已学习的Q值估计进行平均,通过减少目标值中的近似误差方差,带来更稳定的训练过程并提升性能。为理解该算法的效果,我们考察了值函数估计误差的来源,并在一个简化模型中给出了分析比较。我们进一步在Arcade Learning Environment基准上展示了实验,证明了所提扩展显著改善了稳定性和性能。

关键词

引用

@article{arxiv.1611.01929,
  title  = {Averaged-DQN: Variance Reduction and Stabilization for Deep Reinforcement Learning},
  author = {Oron Anschel and Nir Baram and Nahum Shimkin},
  journal= {arXiv preprint arXiv:1611.01929},
  year   = {2017}
}