D4RL:面向深度数据驱动强化学习的数据集
机器学习
2021-02-09 v4 机器学习
摘要
离线强化学习(RL)设定(亦称全批量 RL),即从静态数据集学习策略,颇具吸引力,因为相关进展使 RL 方法能够利用大型已收集数据集,正如大型数据集的兴起推动了监督学习中的成果。然而,现有在线 RL 基准并不面向离线设定,而现有离线 RL 基准局限于由部分训练的智能体所生成的数据,使得离线 RL 的进展难以衡量。本工作中,我们引入专为离线设定设计的基准,以与离线 RL 实际应用相关的数据集关键属性为指导。聚焦于数据集收集,此类属性的例子包括:由手工设计控制器和人类示范者生成的数据集、智能体在同一环境中执行不同任务的多任务数据集,以及由策略混合收集的数据集。通过超越简单基准任务及由部分训练 RL 智能体收集的数据,我们揭示了现有算法重要且未被重视的缺陷。为促进研究,我们发布了基准任务与数据集,并对现有算法进行了全面评估、给出评估协议及开源示例。这作为社区识别现有离线 RL 方法不足的共同起点,以及这一新兴领域协同进步的路径。
引用
@article{arxiv.2004.07219,
title = {D4RL: Datasets for Deep Data-Driven Reinforcement Learning},
author = {Justin Fu and Aviral Kumar and Ofir Nachum and George Tucker and Sergey Levine},
journal= {arXiv preprint arXiv:2004.07219},
year = {2021}
}
备注
Website available at https://sites.google.com/view/d4rl/home