关于离线强化学习的乐观视角
机器学习
2020-11-25 v4 人工智能
机器学习
摘要
使用固定离线数据集(包含记录的交互)的离策略强化学习(RL)是现实世界应用中的重要考量。本文研究使用 DQN 回放数据集的离线 RL,该数据集包含 DQN 智能体在 60 个 Atari 2600 游戏上的全部回放经验。我们证明近期的离策略深度 RL 算法,即使仅在此固定数据集上训练,也能优于完全训练的 DQN 智能体。为增强离线设定下的泛化能力,我们提出随机集成混合(REM),一种鲁棒的 Q-learning 算法,它对多个 Q 值估计的随机凸组合强制最优贝尔曼一致性。在 DQN 回放数据集上训练的离线 REM 超越了强 RL 基线。消融实验突出了离线数据集规模与多样性以及算法选择在我们正向结果中的作用。总体而言,此处结果呈现了一种乐观观点:在足够大且多样的离线数据集上训练的鲁棒 RL 算法可得到高质量策略。DQN 回放数据集可作为离线 RL 基准并已开源。
引用
@article{arxiv.1907.04543,
title = {An Optimistic Perspective on Offline Reinforcement Learning},
author = {Rishabh Agarwal and Dale Schuurmans and Mohammad Norouzi},
journal= {arXiv preprint arXiv:1907.04543},
year = {2020}
}
备注
ICML 2020. An earlier version was titled "Striving for Simplicity in Off-Policy Deep Reinforcement Learning". Project Website: https://offline-rl.github.io