中文

单目视频的动态新视角合成:重建、填充、测试时微调

计算机视觉与模式识别 2026-01-14 v2

摘要

我们探索了从单目视频中进行动态场景的新视角合成。以往方法要么依赖对 4D 表示进行高昂的测试时优化,要么在基于 feed-forward 训练方式下未能保持场景几何结构。我们的做法基于三个关键认知:(1)协程像素(即同时可见于输入视角和目标视角的像素)可通过首先重建动态 3D 场景并从新视角渲染重建结果来实现渲染;(2)新视角中的隐像素可通过基于 feed-forward 的 2D 视频扩散模型进行“填充”。值得注意的是,我们的视频填充扩散模型(CogNVS)可从 2D 视频中自监督训练,允许我们在大规模野外视频语料库上进行训练。这进而使 CogNVS 能够对新测试视频实现零样本测试时微调。我们实证验证了 CogNVS 在单目视频动态场景新视角合成方面几乎超越了几乎所有前沿方法。

关键词

引用

@article{arxiv.2507.12646,
  title  = {Reconstruct, Inpaint, Test-Time Finetune: Dynamic Novel-view Synthesis from Monocular Videos},
  author = {Kaihua Chen and Tarasha Khurana and Deva Ramanan},
  journal= {arXiv preprint arXiv:2507.12646},
  year   = {2026}
}

备注

NeurIPS 2025. Project page: https://cog-nvs.github.io/