D5RL:数据驱动深度强化学习的多样化数据集
机器学习
2024-08-19 v1 机器人学
摘要
离线强化学习算法有望实现无需昂贵或危险真实世界探索的数据驱动强化学习方法,并受益于大规模预收集数据集。这反过来可以促进现实世界的应用,以及更标准化的强化学习研究方法。此外,离线 RL 方法可以为在线微调提供有效初始化,以克服探索方面的挑战。然而,评估离线 RL 算法的进展需要有效且具有挑战性的基准,能够捕捉真实世界任务的特性,提供一系列任务难度,并涵盖领域参数(如时间范围长度、奖励稀疏性)和数据参数(如窄示教数据或宽探索数据)方面的各种挑战。尽管近年来离线 RL 取得了可观进展,这得益于更简单的基准任务,但最广泛使用的数据集在性能上日益饱和,可能无法反映真实任务的特性。我们提出了一种新的离线 RL 基准,专注于真实世界机器人操作和运动环境的真实模拟,基于真实世界机器人系统的模型,并包含多种数据来源,包括脚本化数据、人类遥操作员收集的游玩风格数据以及其他数据源。我们提出的基准涵盖基于状态和基于图像的领域,并支持离线 RL 和在线微调评估,其中一些任务专门设计为需要预训练和微调。我们希望提出的基准能够促进离线 RL 和微调算法的进一步进展。代码、示例、任务和数据的网站可在 \url{https://sites.google.com/view/d5rl/} 获取。
引用
@article{arxiv.2408.08441,
title = {D5RL: Diverse Datasets for Data-Driven Deep Reinforcement Learning},
author = {Rafael Rafailov and Kyle Hatch and Anikait Singh and Laura Smith and Aviral Kumar and Ilya Kostrikov and Philippe Hansen-Estruch and Victor Kolev and Philip Ball and Jiajun Wu and Chelsea Finn and Sergey Levine},
journal= {arXiv preprint arXiv:2408.08441},
year = {2024}
}
备注
RLC 2024