可行动模型:机器人技能的无监督离线强化学习
机器人学
2021-06-14 v3 机器学习
摘要
我们考虑从先前收集的离线数据中学习有用的机器人技能的问题,无需访问手动指定的奖励或额外的在线探索,这一设定对于通过重用过去的机器人数据来扩展机器人学习正变得日益重要。特别地,我们提出了通过学习到达给定数据集中任意目标状态来学习对环境的功能性理解的目标。我们采用带后见之明重标记的目标条件 Q 学习,并开发了若干技术以实现在尤其具挑战性的离线设定中的训练。我们发现我们的方法可以处理高维相机图像,并在真实机器人上学习多种技能,这些技能可泛化到先前未见过的场景和物体。我们还展示了我们的方法可以通过目标链学习跨多个片段的长视野目标,并学习丰富的表示,这些表示可通过预训练或辅助目标帮助下游任务。我们实验的视频可在 https://actionable-models.github.io 找到。
引用
@article{arxiv.2104.07749,
title = {Actionable Models: Unsupervised Offline Reinforcement Learning of Robotic Skills},
author = {Yevgen Chebotar and Karol Hausman and Yao Lu and Ted Xiao and Dmitry Kalashnikov and Jake Varley and Alex Irpan and Benjamin Eysenbach and Ryan Julian and Chelsea Finn and Sergey Levine},
journal= {arXiv preprint arXiv:2104.07749},
year = {2021}
}