不改算法,改数据:面向离线强化学习的探索性数据
机器学习
2022-04-07 v3 人工智能
摘要
深度学习的近期进展依赖于对大规模且多样化数据集的访问。这种数据驱动的进展在离线强化学习(RL)中不太明显,因为离线 RL 数据通常是为了优化特定目标任务而收集的,限制了数据的多样性。在这项工作中,我们提出离线 RL 的探索性数据(ExORL),一种以数据为中心的离线 RL 方法。ExORL 首先通过无监督无奖励探索生成数据,然后在训练离线 RL 策略之前用下游奖励对该数据重新标注。我们发现,探索性数据使得未经任何离线特定修改的原生离策略 RL 算法,在下游任务上优于或与最先进的离线 RL 算法持平。我们的发现表明,对于离线 RL,数据生成与算法进展同样重要,因此需要学界仔细考量。代码与数据可在 https://github.com/denisyarats/exorl 找到。
引用
@article{arxiv.2201.13425,
title = {Don't Change the Algorithm, Change the Data: Exploratory Data for Offline Reinforcement Learning},
author = {Denis Yarats and David Brandfonbrener and Hao Liu and Michael Laskin and Pieter Abbeel and Alessandro Lazaric and Lerrel Pinto},
journal= {arXiv preprint arXiv:2201.13425},
year = {2022}
}