从人类示范中学习跨长视野任务的泛化能力
机器人学
2021-06-24 v2 人工智能
机器学习
摘要
模仿学习是一种在真实世界中训练机器人策略的有效且安全的技术,因为它不依赖于昂贵的随机探索过程。然而,由于缺乏探索,学习能够泛化到所示范行为之外的策略仍然是一个开放挑战。我们提出一种新颖的模仿学习框架,使机器人能够 1)从少量人类示范中高效学习复杂的真实世界操作任务,以及 2)合成所收集示范中未包含的新行为。我们的核心见解是,多任务领域通常呈现一种潜在结构,其中不同任务的示范轨迹在状态空间的公共区域相交。我们提出通过模仿进行泛化(GTI),一种两阶段离线模仿学习算法,它利用这种相交结构来训练目标导向策略,使其泛化到未见过的起始与目标状态组合。在 GTI 的第一阶段,我们训练一个随机策略,利用轨迹相交来具备将不同示范轨迹的行为组合在一起的能力。在 GTI 的第二阶段,我们从第一阶段的无条件随机策略中收集一小部分 rollout,并训练一个目标导向智能体以泛化到新颖的起始和目标配置。我们在仿真领域以及一个具有挑战性的真实世界长视野机器人操作领域中验证了 GTI。更多结果和视频可在 https://sites.google.com/view/gti2020/ 获取。
引用
@article{arxiv.2003.06085,
title = {Learning to Generalize Across Long-Horizon Tasks from Human Demonstrations},
author = {Ajay Mandlekar and Danfei Xu and Roberto Martín-Martín and Silvio Savarese and Li Fei-Fei},
journal= {arXiv preprint arXiv:2003.06085},
year = {2021}
}
备注
RSS 2020; First two authors contributed equally