平均DQN:深度强化学习的方差缩减与稳定化
人工智能
2017-03-13 v4 机器学习
机器学习
摘要
深度强化学习(DRL)算法的非稳定性和变异性往往会对其性能产生不利影响。平均DQN是对DQN算法的一种简单扩展,基于对已学习的Q值估计进行平均,通过减少目标值中的近似误差方差,带来更稳定的训练过程并提升性能。为理解该算法的效果,我们考察了值函数估计误差的来源,并在一个简化模型中给出了分析比较。我们进一步在Arcade Learning Environment基准上展示了实验,证明了所提扩展显著改善了稳定性和性能。
引用
@article{arxiv.1611.01929,
title = {Averaged-DQN: Variance Reduction and Stabilization for Deep Reinforcement Learning},
author = {Oron Anschel and Nir Baram and Nahum Shimkin},
journal= {arXiv preprint arXiv:1611.01929},
year = {2017}
}