中文

通过3D基础先验实现真实且一致的轨道视频生成

计算机视觉与模式识别 2026-04-15 v1

摘要

我们提出了一种新方法,用于从单张物体图像生成几何真实且一致的轨道视频。现有视频生成工作大多依赖像素级注意力机制以确保跨帧的视图一致性。然而,这种机制对长程外推(例如后视视图合成)施加的约束不足,因而在像素对应输入图像的范围有限的情况下,常常难以生成具有合理且连贯结构的结果。为此,我们提出利用来自3D基础生成模型的丰富形状先验作为辅助约束,借此其对从大型3D资产语料库中学习的真实物体形状分布建模能力。具体而言,我们通过来自3D基础模型编码的两种尺度的隐式特征激活视频生成:(i) 作为整体结构引导的去噪全局隐向量,以及(ii) 从体积特征投影到隐式图像上的一组隐式图像,以提供视图依赖且细粒度的几何细节。与常用的2.5D表示(如深度或法线图)不同,这些紧凑特征可建模完整物体形状,并通过避免显式网格提取来提高推理效率。为实现有效的形状条件化,我们引入多尺度3D适配器通过跨注意力机制将特征标记注入基础视频模型,从而保留其来自通用视频预训练的能力,并实现简单且模型无关的微调过程。在多个基准上的大量实验表明,我们的方法在视觉质量、形状真实性和多视角一致性方面均优于最先进的方法,并且能稳健地推广至复杂摄像机轨迹和野外图像。

关键词

引用

@article{arxiv.2604.12309,
  title  = {Towards Realistic and Consistent Orbital Video Generation via 3D Foundation Priors},
  author = {Rong Wang and Ruyi Zha and Ziang Cheng and Jiayu Yang and Pulak Purkait and Hongdong Li},
  journal= {arXiv preprint arXiv:2604.12309},
  year   = {2026}
}

备注

Accepted to CVPR 2026