从玩耍中学习潜在规划
机器人学
2019-12-23 v2
摘要
为机器人获取多样化的通用技能库仍是一项开放挑战。本文提出在人工遥操作玩耍数据之上进行自监督控制,以此扩展技能学习规模。相较于常规任务演示,玩耍具两项吸引人特性:玩耍成本低,可在大量快速收集中无需任务分割、标注或重置初始状态;玩耍天然丰富,相同收集时间内覆盖约 4 倍于任务演示的交互空间。为从玩耍学习控制,我们引入 Play-LMP,一种自监督方法,学习将玩耍行为组织于潜空间,并在测试时复用它们以实现特定目标。将自监督控制与多样玩耍数据集结合,把技能学习焦点从狭窄离散的任务集转向环境中可用的完整连续行为。我们发现该组合在经验上泛化良好——在对无标注玩耍自监督后,我们的方法在模拟机器人桌面环境的 18 个困难用户指定视觉操纵任务上大幅优于单独专家训练策略。我们还发现,受玩耍监督的模型不同于其专家训练对应物,对扰动更鲁棒并表现出重试至成功行为。最后,我们发现尽管从未以任务标签训练,我们的智能体围绕功能性任务组织其潜在规划空间。视频、代码与数据见 learning-from-play.github.io。
引用
@article{arxiv.1903.01973,
title = {Learning Latent Plans from Play},
author = {Corey Lynch and Mohi Khansari and Ted Xiao and Vikash Kumar and Jonathan Tompson and Sergey Levine and Pierre Sermanet},
journal= {arXiv preprint arXiv:1903.01973},
year = {2019}
}
备注
Published at CoRL 2019 (3rd Conference on Robot Learning, Osaka, Japan)