中文

自校正Q学习

机器学习 2021-02-03 v2

摘要

Q学习算法已知会受到最大化偏差的影响,即对动作值的系统性高估,这是一个近期重新受到关注的重要问题。双重Q学习已被提出作为一种缓解该偏差的高效算法。然而,这代价是动作值的低估,此外还增加了内存需求并减慢了收敛速度。在本文中,我们引入了一种解决最大化偏差的新方法,其形式为一种用于近似期望值最大值的“自校正算法”。我们的方法平衡了常规Q学习中使用的单一估计器的过高估计与双重Q学习中使用的双重估计器的过低估计。将该策略应用于Q学习得到了自校正Q学习。我们从理论上证明,这一新算法享有与Q学习相同的收敛保证,同时具有更高的准确性。在经验上,它在奖励高方差的领域中表现优于双重Q学习,甚至在奖励为零或低方差的领域中比Q学习收敛更快。这些优势迁移到了我们称之为自校正DQN的Deep Q Network实现中,该实现在Atari 2600领域的若干任务上优于常规DQN和双重DQN。

关键词

引用

@article{arxiv.2012.01100,
  title  = {Self-correcting Q-Learning},
  author = {Rong Zhu and Mattia Rigotti},
  journal= {arXiv preprint arXiv:2012.01100},
  year   = {2021}
}

备注

Thirty-Fifth AAAI Conference on Artificial Intelligence (AAAI-21)