如何在离线强化学习中利用无标签数据
机器学习
2022-07-11 v4 人工智能
机器人学
摘要
离线强化学习(RL)可以从静态数据集中学习控制策略,但像标准RL方法一样,它需要对每次转移进行奖励标注。在许多情况下,用奖励标注大型数据集可能代价高昂,特别是当这些奖励必须由人类标注者提供时,而收集多样化的无标签数据可能相对便宜。我们如何才能在离线RL中最好地利用此类无标签数据?一个自然的解决方案是从有标签数据中学习奖励函数,并用它来标注无标签数据。在本文中,我们发现,也许令人惊讶的是,一种更简单的、仅对无标签数据施加零奖励的方法在理论和实践上都能实现有效的数据共享,而完全不需要学习任何奖励模型。尽管这种方法起初看起来奇怪(且不正确),我们提供了广泛的理论和实证分析,说明它如何权衡奖励偏差、样本复杂性和分布偏移,常带来良好结果。我们刻画了该简单策略生效的条件,并进一步展示用简单的重加权方法扩展它可进一步缓解使用不正确奖励标签引入的偏差。我们的实证评估在模拟机器人运动、导航和操作环境中证实了这些发现。
引用
@article{arxiv.2202.01741,
title = {How to Leverage Unlabeled Data in Offline Reinforcement Learning},
author = {Tianhe Yu and Aviral Kumar and Yevgen Chebotar and Karol Hausman and Chelsea Finn and Sergey Levine},
journal= {arXiv preprint arXiv:2202.01741},
year = {2022}
}
备注
ICML 2022