论 Double Q-Learning 中的估计偏差
机器学习
2022-01-17 v3 人工智能
机器学习
摘要
Double Q-learning 是一种用于减少过高估计偏差的经典方法,该偏差由 Bellman 操作中取最大估计值引起。其在深度 Q-learning 范式中的变体在产生可靠的价值预测和提升学习性能方面展现出了巨大潜力。然而,如先前工作所示,double Q-learning 并非完全无偏,且存在过低估计偏差。在本文中,我们证明这种过低估计偏差可能在近似 Bellman 算子下导致多个非最优不动点。为了解决收敛到非最优平稳解的问题,我们提出了一种简单但有效的方法,作为 double Q-learning 中过低估计偏差的部分修复。该方法利用近似动态规划来限制目标值。我们在 Atari 基准任务中广泛评估了所提出的方法,并证明了其相对于基线算法的显著改进。
引用
@article{arxiv.2109.14419,
title = {On the Estimation Bias in Double Q-Learning},
author = {Zhizhou Ren and Guangxiang Zhu and Hao Hu and Beining Han and Jianglun Chen and Chongjie Zhang},
journal= {arXiv preprint arXiv:2109.14419},
year = {2022}
}
备注
Thirty-Fifth Conference on Neural Information Processing Systems (NeurIPS 2021)