中文

\textsc{Gen2Real}:利用生成视频实现无演示的灵巧操纵

机器人学 2025-09-18 v1

摘要

灵巧操纵始终是机器人学中的难题,主要源于收集大量人类演示的成本高。本文引入 \textsc{Gen2Real},用一个生成视频取代昂贵的人类演示,驱动机器人技能学习:它结合演示生成(利用视频生成)和姿态、深度估计以产生手部-物体轨迹、运动优化(使用物理感知交互优化模型 PIOM 以保证物理一致性)以及演示学习(将人类动作定向到机器人手部并通过基于锚点的残差型 PPO 政策进行稳定控制)。仅使用生成视频,所学策略在仿真中的抓取任务成功率达 77.3%,并在真实机器人上实现连贯的执行。我们还进行了消融研究,以验证每个组件的贡献,并演示了能够直接使用自然语言指定任务,凸显了 \textsc{Gen2Real} 在从想象的视频推广到真实世界执行方面的灵活性和鲁棒性。

关键词

引用

@article{arxiv.2509.14178,
  title  = {\textsc{Gen2Real}: Towards Demo-Free Dexterous Manipulation by Harnessing Generated Video},
  author = {Kai Ye and Yuhang Wu and Shuyuan Hu and Junliang Li and Meng Liu and Yongquan Chen and Rui Huang},
  journal= {arXiv preprint arXiv:2509.14178},
  year   = {2025}
}