中文

RoboPaint:从人类演示到任意机器人与任意视角

机器人学 2026-02-10 v2

摘要

获取大规模、高保真的机器人演示数据仍然是扩展灵巧操作中视觉-语言-动作模型的关键瓶颈。我们提出了一种真实-仿真-真实数据收集与数据编辑流水线,该流水线无需直接机器人遥操作,即可将人类演示转化为机器人可执行的、环境特定的训练数据。我们构建了标准化的数据收集室,以捕获多模态人类演示(同步的3个RGB-D视频、11个RGB视频、29自由度手套关节角度和14通道触觉信号)。基于这些人类演示,我们引入了一种触觉感知的重定向方法,通过几何和力引导优化将人类手部状态映射到机器人灵巧手状态。然后,重定向后的机器人轨迹在逼真的Isaac Sim环境中渲染,以构建机器人训练数据。真实世界实验表明:(1) 重定向后的灵巧手轨迹在10个不同的物体操作任务中达到了84%的成功率。(2) 仅使用我们生成的数据训练的VLA策略(Pi0.5)在三个代表性任务(即抓取放置、推和倒)上达到了80%的平均成功率。总之,使用我们的真实-仿真-真实数据流水线,可以高效地从人类演示中“绘制”出机器人训练数据。我们提供了一种可扩展、经济高效的遥操作替代方案,对于复杂的灵巧操作,性能损失极小。

关键词

引用

@article{arxiv.2602.05325,
  title  = {RoboPaint: From Human Demonstration to Any Robot and Any View},
  author = {Jiacheng Fan and Zhiyue Zhao and Yiqian Zhang and Chao Chen and Peide Wang and Hengdi Zhang and Zhengxue Cheng},
  journal= {arXiv preprint arXiv:2602.05325},
  year   = {2026}
}

备注

17 pages