中文

论深度 Q-Learning 的方差与过高估计的降低

机器学习 2024-04-16 v2 机器学习

摘要

深度 Q-Learning 在不同类型环境上的突破革新了强化学习的算法设计,催生了更稳定、更鲁棒的算法;为此,已提出许多深度 Q-Learning 算法的扩展以降低目标值的方差与过高估计现象。本文研究解决这些问题的新方法,提出在深度 Q-Learning 算法上使用 Dropout 技术作为降低方差与过高估计的手段。我们还展示了在基准环境上进行的实验,证明了该方法在增强稳定性及降低模型性能中方差与过高估计方面的有效性。

关键词

引用

@article{arxiv.1910.05983,
  title  = {On the Reduction of Variance and Overestimation of Deep Q-Learning},
  author = {Mohammed Sabry and Amr M. A. Khalifa},
  journal= {arXiv preprint arXiv:1910.05983},
  year   = {2024}
}