中文

SPHINX:基于显著点的混合模仿学习

机器人学 2024-12-10 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

虽然模仿学习(IL)提供了一个教导机器人执行各种行为的有前景的框架,但学习复杂任务仍然具有挑战性。现有的IL策略在面对视觉和空间变化时难以有效泛化,即使对于简单任务也是如此。本文引入SPHINX:基于显著点的混合模仿学习与执行,一种灵活的IL策略,利用多模态观察(点云和手腕图像),以及低频稀疏 waypoint 和高频密集末端执行器运动的混合动作空间。给定3D点云观察,SPHINX学习推断点云中任务相关点的显著点,这些显著点通过聚焦于语义上有意义的特征来支持空间泛化。这些显著点作为锚点来预测长距离移动的 waypoint,例如到达自由空间中的目标姿态。一旦接近显著点,SPHINX学习切换为基于靠近的手腕图像预测密集的末端执行器运动,以进行任务的精细阶段。通过针对不同操纵阶段利用不同输入模态和动作表示的优势,SPHINX以样本高效、通用的方法解决复杂任务。我们的方法在4个真实世界和2个模拟任务中实现了86.7%的成功率,在440次真实世界试验中超过下一个最佳IL基线平均提高了41.1%。SPHINX还能够泛化到新视角、视觉干扰、空间布局和执行速度,相对于最具竞争力的基线实现了1.7倍的加速。我们的网站(http://sphinx-manip.github.io)提供了用于数据收集、训练和评估的开源代码,以及补充视频。

关键词

引用

@article{arxiv.2412.05426,
  title  = {What's the Move? Hybrid Imitation Learning via Salient Points},
  author = {Priya Sundaresan and Hengyuan Hu and Quan Vuong and Jeannette Bohg and Dorsa Sadigh},
  journal= {arXiv preprint arXiv:2412.05426},
  year   = {2024}
}