GenVid2Robot:通过刚体几何一致性从视频生成到机器人操作
机器人学
2026-07-10 v1 机器学习
摘要
生成的视频为机器人操作提供了有用的视觉运动先验,但其视觉合理性并不保证物理可执行性。生成的视频通常缺乏度量几何、抓取基础、机器人运动学可行性以及执行时的反馈,这使得直接轨迹重放在真实世界操作中不可靠。本文提出了GenVid2Robot,一个刚体几何一致性框架,将生成的视频运动转化为可执行的真实机器人操作轨迹。给定初始RGB-D观测和任务指令,GenVid2Robot从真实首帧中采样与任务相关的语义锚点,在生成的视频候选中跟踪这些锚点,并验证在稀疏相对模型下,所得的2D运动是否可由首帧RGB-D锚点解释。通过这种方式,生成的视频被视为不确定的视觉运动假设,而非直接的机器人演示。只有几何一致的运动才会被转移到机器人上。然后,将接受的相对运动应用于由掩码约束抓取选择的真实抓取时刻TCP位姿,生成一个与视觉运动先验和物理抓取配置一致的、以抓取为条件的执行轨迹。为了减少由RGB-D噪声、标定残差和小的接触引起的位移导致的执行不匹配,一个有界的深度补偿模块在不假设完全在线重规划的情况下纠正局部深度方向误差。真实机器人实验表明,GenVid2Robot通过将视觉运动先验与稀疏度量几何、抓取约束、机器人可行性检查和有界执行反馈相结合,提高了生成视频引导操作的可靠性。
引用
@article{arxiv.2607.09191,
title = {GenVid2Robot: From Video Generation to Robot Manipulation via Rigid-Geometric Consistency},
author = {Haohui Huang and Xi Yuan and Panpan Liao and Tao Teng and Chenguang Yang and Jing Guo and Yi Guo},
journal= {arXiv preprint arXiv:2607.09191},
year = {2026}
}
备注
Preprint