基于单人类视频视觉模仿的插槽级机器人放置
机器人学
2025-04-03 v1 计算机视觉与模式识别
摘要
现代机器人学习方法的主要焦点是针对一组预定义任务进行学习,这些任务在新任务上的泛化有限或为零。将机器人技能扩展到新任务涉及为额外的任务收集大量的训练数据。在本文中,我们解决了使用人类演示视频教授新任务的问题,后者针对重复性任务(例如装箱)。该任务需要理解人类视频以识别正在操作的对象(拾取对象)以及其放置位置(放置槽)。此外,它需要在推理期间重新识别拾取对象和放置槽 along with 相对姿态,以启用机器人执行任务。为解决此问题,我们提出了 SLeRP,一种模块化系统,利用了几项先进的视觉基础模型和一种新颖的插槽级放置检测器 Slot-Net,消除对用于训练的昂贵视频演示的需求。我们使用新的真实世界视频基准进行了评估。评估结果表明,SLeRP 在多个基准上优于多个基线方法,并可在实际机器人上部署。
引用
@article{arxiv.2504.01959,
title = {Slot-Level Robotic Placement via Visual Imitation from Single Human Video},
author = {Dandan Shan and Kaichun Mo and Wei Yang and Yu-Wei Chao and David Fouhey and Dieter Fox and Arsalan Mousavian},
journal= {arXiv preprint arXiv:2504.01959},
year = {2025}
}