中文

OCRA:用于人类到机器人动作传递的对象中心学习,结合3D和触觉先验

机器人学 2026-03-17 v1 计算机视觉与模式识别

摘要

我们提出OCRA,这是一个面向视频的人类到机器人动作传递的对象中心框架,直接从人类演示视频中学习以实现稳健的操纵。对象中心学习强调任务相关对象及其交互,同时过滤掉无关背景,为教导机器人提供一种自然且可扩展的方法。OCRA利用多视角RGB视频、最先进的3D基础模型VGGT,以及先进的检测和分割模型来重建对象中心3D点云,捕捉对象之间丰富的交互。为了处理视觉难以感知的属性,我们整合了来自超过一百万张触觉图像的触觉先验。这些3D和触觉先验通过多模态模块(ResFiLM)融合,并输入到扩散策略中以生成稳健的操纵动作。在视觉专用和视觉-触觉任务上的大量实验显示,OCRA显著优于现有基线和消检实验,证明了其从人类演示视频中学习的有效性。

关键词

引用

@article{arxiv.2603.14401,
  title  = {OCRA: Object-Centric Learning with 3D and Tactile Priors for Human-to-Robot Action Transfer},
  author = {Kuanning Wang and Ke Fan and Yuqian Fu and Siyu Lin and Hu Luo and Daniel Seita and Yanwei Fu and Yu-Gang Jiang and Xiangyang Xue},
  journal= {arXiv preprint arXiv:2603.14401},
  year   = {2026}
}

备注

Project page: https://sressers.github.io/OCRA/