中文

面向Q学习的集成自助法

机器学习 2021-04-21 v2 人工智能 机器学习

摘要

Q学习(QL)是一种常用的强化学习算法,由于最优 Bellman 算子中的最大化项而遭受过高估计偏差。该偏差可能导致次优行为。Double-Q-learning 利用两个估计量解决此问题,却导致欠估计偏差。类似于 Q学习中的过高估计,在某些场景中,欠估计偏差可能降低性能。本工作中,我们引入一种称为集成自助 Q学习(EBQL)的新的降偏算法,它是 Double-Q-learning 向集成器的自然扩展。我们从理论与经验两方面分析该方法。理论上,我们证明 EBQL 类更新在估计一组独立随机变量的最大均值时产生更低的 MSE。经验上,我们表明存在一些领域,其中过高与欠估计均导致次优性能。最后,我们展示了 EBQL 的深度 RL 变体在一组 ATARI 游戏上优于其他深度 QL 算法。

关键词

引用

@article{arxiv.2103.00445,
  title  = {Ensemble Bootstrapping for Q-Learning},
  author = {Oren Peer and Chen Tessler and Nadav Merlis and Ron Meir},
  journal= {arXiv preprint arXiv:2103.00445},
  year   = {2021}
}