具有在线自监督的离线元强化学习
机器学习
2022-07-08 v4 人工智能
机器人学
摘要
元强化学习(RL)方法可以元训练出能以比标准 RL 少几个数量级的数据适应新任务的策略,但元训练本身成本高且耗时。若能在离线数据上元训练,则可复用同一静态数据集(为不同任务以奖励标注一次)来元训练能在元测试时适应多种新任务的策略。尽管该能力将使元 RL 成为实际应用的实用工具,离线元 RL 相较于在线元 RL 或标准离线 RL 设定带来了额外挑战。元 RL 学习一种收集数据用于适应的探索策略,并元训练一种能快速适应来自新任务数据的策略。由于该策略在固定的离线数据集上元训练,当适应由所学探索策略收集的数据时可能表现不可预测,后者与离线数据有系统性差异从而引致分布偏移。我们提出一种混合离线元 RL 算法,其利用带奖励的离线数据元训练自适应策略,然后收集额外的无监督在线数据(无任何奖励标签)以弥合该分布偏移。由于在线收集不需奖励标签,该数据收集成本低得多。我们在模拟机器人运动与操作任务上将方法与先前离线元 RL 工作比较,发现使用额外无监督在线数据收集显著提升了元训练策略的适应能力,在一系列需泛化至新任务的困难领域上匹配了完全在线元 RL 的性能。
引用
@article{arxiv.2107.03974,
title = {Offline Meta-Reinforcement Learning with Online Self-Supervision},
author = {Vitchyr H. Pong and Ashvin Nair and Laura Smith and Catherine Huang and Sergey Levine},
journal= {arXiv preprint arXiv:2107.03974},
year = {2022}
}
备注
8.5 pages, 6 figures, accepted to ICML 2022