基于演示与无标注经验的离线学习
机器学习
2020-11-30 v1 人工智能
机器人学
机器学习
摘要
行为克隆(BC)对于机器人学习通常是实用的,因为它允许通过专家演示上的监督学习,在无需奖励的情况下离线训练策略。然而,BC 不能有效利用我们称之为无标注经验的数据:质量混杂且未知、没有奖励标注的数据。该无标注数据可由多种来源生成,例如人类遥操作、脚本策略以及同一机器人上的其他智能体。面向能够利用此无标注经验的数据驱动离线机器人学习,我们引入了离线强化模仿学习(ORIL)。ORIL 首先通过对比演示轨迹与无标注轨迹中的观测来学习奖励函数,然后用学习到的奖励标注所有数据,最后通过离线强化学习训练智能体。在一系列多样的连续控制与模拟机器人操作任务中,我们表明 ORIL 通过有效利用无标注经验,持续优于可比较的 BC 智能体。
引用
@article{arxiv.2011.13885,
title = {Offline Learning from Demonstrations and Unlabeled Experience},
author = {Konrad Zolna and Alexander Novikov and Ksenia Konyushkova and Caglar Gulcehre and Ziyu Wang and Yusuf Aytar and Misha Denil and Nando de Freitas and Scott Reed},
journal= {arXiv preprint arXiv:2011.13885},
year = {2020}
}
备注
Accepted to Offline Reinforcement Learning Workshop at Neural Information Processing Systems (2020)