稀疏新视角合成作为视频完成
计算机视觉与模式识别
2026-04-10 v1
摘要
我们解决了使用视频扩散模型进行稀疏新视角合成(NVS)的问题;给定 (约5个)场景的多视角图像及其相机姿态,我们预测目标相机姿态下的视图。许多先前方法利用通过扩散模型编码的生成式图像先验。然而,训练于单张图像的模型缺乏多视角知识。我们认为视频模型已包含隐式的多视角知识,因此更容易适用于NVS。我们的关键见解是将稀疏NVS形式化为低帧率视频完成任务。然而,一个挑战在于,稀疏NVS定义在无序的输入集合上,由于稀疏,往往难以定义有意义的顺序,因此模型应对该输入集合的排列具有不变性。为此,我们提出了FrameCrafter,通过几项架构修改,将视频模型(自然训练于有协调帧顺序)适配为不变性NVS,包括逐帧潜在编码和移除时间位置嵌入。我们的结果表明,视频模型可以轻松训练以“忘记”时间,仅用最小监督即可在稀疏视图NVS基准上达到竞争性能。项目页面: https://frame-crafter.github.io/
关键词
引用
@article{arxiv.2604.08500,
title = {Novel View Synthesis as Video Completion},
author = {Qi Wu and Khiem Vuong and Minsik Jeon and Srinivasa Narasimhan and Deva Ramanan},
journal= {arXiv preprint arXiv:2604.08500},
year = {2026}
}
备注
Project page: https://frame-crafter.github.io/