中文

面向长视野视觉运动任务的样例驱动基于模型的强化学习

机器人学 2022-09-20 v2 人工智能 机器学习

摘要

本文中,我们研究从原始图像学习一组底层技能并将其序列化以完成长视野视觉运动任务的问题。强化学习 (RL) 是一种有前景的自主获取短视野技能的方法。然而,RL 算法的重点大多在于这些独立技能的成功,而非学习与落地一个可被序列化以完成扩展多阶段任务的大型技能库。后者要求鲁棒性与持久性,因为技能中的错误会随时间累积,并可能要求机器人技能库中拥有若干基本技能而非仅一个。为此,我们提出 EMBER,一种基于模型的 RL 方法,用于学习适于完成长视野视觉运动任务的原始技能。EMBER 利用学习得到的模型、critic 与成功分类器进行学习与规划,其中成功分类器既作为 RL 的奖励函数,也作为落地机制,在机器人未成功或受扰动时持续检测其是否应重试技能。此外,所学模型是任务无关的,并使用来自所有技能的数据训练,使机器人能高效学习多个不同原语。这些视觉运动原语技能及其关联的前置与后置条件可直接与现成符号规划器结合以完成长视野任务。在 Franka Emika 机械臂上,我们发现 EMBER 使机器人以 85% 成功率完成三项长视野视觉运动任务,如整理办公桌、文件柜与抽屉,其需序列化多达 12 个技能,涉及 14 个独特所学原语,并需要对新物体泛化。

关键词

引用

@article{arxiv.2109.10312,
  title  = {Example-Driven Model-Based Reinforcement Learning for Solving Long-Horizon Visuomotor Tasks},
  author = {Bohan Wu and Suraj Nair and Li Fei-Fei and Chelsea Finn},
  journal= {arXiv preprint arXiv:2109.10312},
  year   = {2022}
}

备注

Equal advising and contribution for last two authors