中文

基于单人类视频视觉模仿的插槽级机器人放置

机器人学 2025-04-03 v1 计算机视觉与模式识别

摘要

现代机器人学习方法的主要焦点是针对一组预定义任务进行学习,这些任务在新任务上的泛化有限或为零。将机器人技能扩展到新任务涉及为额外的任务收集大量的训练数据。在本文中,我们解决了使用人类演示视频教授新任务的问题,后者针对重复性任务(例如装箱)。该任务需要理解人类视频以识别正在操作的对象(拾取对象)以及其放置位置(放置槽)。此外,它需要在推理期间重新识别拾取对象和放置槽 along with 相对姿态,以启用机器人执行任务。为解决此问题,我们提出了 SLeRP,一种模块化系统,利用了几项先进的视觉基础模型和一种新颖的插槽级放置检测器 Slot-Net,消除对用于训练的昂贵视频演示的需求。我们使用新的真实世界视频基准进行了评估。评估结果表明,SLeRP 在多个基准上优于多个基线方法,并可在实际机器人上部署。

关键词

引用

@article{arxiv.2504.01959,
  title  = {Slot-Level Robotic Placement via Visual Imitation from Single Human Video},
  author = {Dandan Shan and Kaichun Mo and Wei Yang and Yu-Wei Chao and David Fouhey and Dieter Fox and Arsalan Mousavian},
  journal= {arXiv preprint arXiv:2504.01959},
  year   = {2025}
}