GDI:重新思考强化学习区别于监督学习的本质
机器学习
2022-01-11 v6 人工智能
神经与进化计算
摘要
Deep Q Network(DQN)通过将深度学习(DL)与强化学习(RL)相结合,首次敲开了深度强化学习(DRL)的大门,其注意到所获取数据的分布会在训练过程中发生变化。DQN 发现这一特性可能导致训练不稳定,因此提出了有效方法来应对该特性的负面影响。与关注不利方面不同,我们发现 RL 的关键在于缩小估计数据分布与真实数据分布之间的差距,而监督学习(SL)无法实现这一点。从这一新视角出发,我们将 RL 的基本范式——广义策略迭代(GPI)扩展为更通用的版本,称为广义数据分布迭代(GDI)。我们看到大量 RL 算法与技术均可统一到 GDI 范式下,其可视为 GDI 的特例之一。我们提供了 GDI 优于 GPI 及其作用机理的理论证明。基于 GDI 提出了若干实用算法以验证其有效性与广泛性。实证实验证明了我们在 Arcade Learning Environment(ALE)上的 state-of-the-art(SOTA)性能,其中我们的算法仅使用 200M 训练帧即取得了 9620.98% 的平均人类归一化得分(HNS)、1146.39% 的中位数 HNS 以及 22 项人类世界纪录突破(HWRB)。我们的工作旨在引领 RL 研究步入征服人类世界纪录的征程,并寻求在性能与效率上均真正超越人类的智能体。
引用
@article{arxiv.2106.06232,
title = {GDI: Rethinking What Makes Reinforcement Learning Different From Supervised Learning},
author = {Jiajun Fan and Changnan Xiao and Yue Huang},
journal= {arXiv preprint arXiv:2106.06232},
year = {2022}
}