中文

通过视频生成环境表示从单张图像到运动策略

机器人学 2025-05-27 v1 计算机视觉与模式识别 图形学 机器学习

摘要

自主机器人通常需要构建周围环境的表示,并使其运动适应环境的几何结构。在此,我们解决从单张输入 RGB 图像构建策略模型以生成符合环境的无碰撞运动的问题。从单张图像提取 3D 结构通常涉及单目深度估计。深度估计的发展催生了诸如 DepthAnything 等大型预训练模型。然而,由于会产生视锥体状误差,将这些模型的输出用于下游运动生成具有挑战性。相反,我们提出了一种称为视频生成环境表示(VGER)的框架,该框架利用大规模视频生成模型的进展,生成以输入图像为条件的移动相机视频。该视频的帧形成多视图数据集,随后被输入到预训练的 3D 基础模型以生成密集点云。然后,我们引入多尺度噪声方法来训练环境结构的隐式表示,并构建符合该表示几何结构的运动生成模型。我们在多种室内和室外环境中广泛评估了 VGER。我们展示了其从单张 RGB 输入图像生成考虑场景捕获几何结构的平滑运动的能力。

关键词

引用

@article{arxiv.2505.19306,
  title  = {From Single Images to Motion Policies via Video-Generation Environment Representations},
  author = {Weiming Zhi and Ziyong Ma and Tianyi Zhang and Matthew Johnson-Roberson},
  journal= {arXiv preprint arXiv:2505.19306},
  year   = {2025}
}