中文

基于 RGB 人类视频的 3D 手-物体轨迹重建获取力柔性操纵策略

机器人学 2026-02-13 v2 计算机视觉与模式识别

摘要

多指机器人手的操纵和抓取由于动作空间的高维度和获取大规模训练数据的困难而具有挑战性。现有方法主要依赖人类遥操作搭配可穿戴设备或专业传感器来捕获手-物体交互,这限制了可扩展性。本文提出了 VIDEOMANIP—a 一个无设备框架,直接从 RGB 人类视频中学习力柔性操纵。利用最近的计算机视觉进展,VIDEOMANIP 通过估计人类手部姿态、物体网格并将重建的人类动作 retarget 至机器人手部,实现从单目视频重建显式的 3D 机器人-物体轨迹。为使重建的机器人数据适用于力柔性操纵训练,我们引入了基于交互的抓取建模的手-物体接触优化,以及一种从单个视频生成多样化训练轨迹的演示合成策略,使其能够在无需额外机器人演示的情况下进行通用策略学习。在仿真中,使用 Inspire Hand,学习的抓取模型在 20 个不同物体上实现了 70.25% 的成功率。在实际环境中,使用 LEAP Hand,基于 RGB 视频训练的操纵策略在七个任务上实现平均 62.86% 的成功率,相较于基于 retarget 的方法提升了 15.87%。项目视频可在 videomanip.github.io 查看。

关键词

引用

@article{arxiv.2602.09013,
  title  = {Dexterous Manipulation Policies from RGB Human Videos via 3D Hand-Object Trajectory Reconstruction},
  author = {Hongyi Chen and Tony Dong and Tiancheng Wu and Liquan Wang and Yash Jangir and Yaru Niu and Yufei Ye and Homanga Bharadhwaj and Zackory Erickson and Jeffrey Ichnowski},
  journal= {arXiv preprint arXiv:2602.09013},
  year   = {2026}
}