面向Q学习的集成自助法
机器学习
2021-04-21 v2 人工智能
机器学习
摘要
Q学习(QL)是一种常用的强化学习算法,由于最优 Bellman 算子中的最大化项而遭受过高估计偏差。该偏差可能导致次优行为。Double-Q-learning 利用两个估计量解决此问题,却导致欠估计偏差。类似于 Q学习中的过高估计,在某些场景中,欠估计偏差可能降低性能。本工作中,我们引入一种称为集成自助 Q学习(EBQL)的新的降偏算法,它是 Double-Q-learning 向集成器的自然扩展。我们从理论与经验两方面分析该方法。理论上,我们证明 EBQL 类更新在估计一组独立随机变量的最大均值时产生更低的 MSE。经验上,我们表明存在一些领域,其中过高与欠估计均导致次优性能。最后,我们展示了 EBQL 的深度 RL 变体在一组 ATARI 游戏上优于其他深度 QL 算法。
引用
@article{arxiv.2103.00445,
title = {Ensemble Bootstrapping for Q-Learning},
author = {Oren Peer and Chen Tessler and Nadav Merlis and Ron Meir},
journal= {arXiv preprint arXiv:2103.00445},
year = {2021}
}