无监督数据共享对离线强化学习的可证明收益
机器学习
2023-02-28 v1 人工智能
摘要
自监督方法通过利用数据自身来减少对昂贵标注的需求,已成为推进深度学习的关键。然而,如何以原则性方式进行自监督离线强化学习(RL)仍不明确。本文通过在半监督设定下考察线性马尔可夫决策过程(MDPs)中利用无奖励数据的理论收益来解决此问题。此外,我们提出了一种新颖的可证明数据共享算法(PDS),以利用此类无奖励数据进行离线 RL。PDS 对从有标签数据学到的奖励函数施加额外惩罚以防止过高估计,从而确保算法的保守性。我们在各类离线 RL 任务上的结果表明,PDS 显著提升了利用无奖励数据的离线 RL 算法性能。总体而言,我们的工作提供了一种在保持理论保证的同时利用离线 RL 中无标签数据收益的有前景的方法。我们相信我们的发现将有助于开发更鲁棒的自监督 RL 方法。
引用
@article{arxiv.2302.13493,
title = {The Provable Benefits of Unsupervised Data Sharing for Offline Reinforcement Learning},
author = {Hao Hu and Yiqin Yang and Qianchuan Zhao and Chongjie Zhang},
journal= {arXiv preprint arXiv:2302.13493},
year = {2023}
}
备注
Eleventh International Conference on Learning Representations (ICLR), 2023