中文

基于测试时自然视频完成的稀疏输入新视角合成

计算机视觉与模式识别 2025-11-25 v1 图形学

摘要

仅凭几张场景快照,就能想象当相机在其中穿梭时呈现的电影情景吗?我们从稠密输入新视角合成的角度出发,不仅视为在视角间填补空间空隙,更视为\emph{完成贯穿空间的自然视频}。我们将任务重塑为\emph{测试时自然视频完成},利用\emph{预训练视频扩散模型}的强大先验进行肉眼合成。我们的\emph{零样本、生成导向}框架通过\emph{不确定性感知机制}实现空间一致性,产生新相机位置的伪视图。这些合成帧为\emph{3D 高斯溅写}(3D-GS)的场景重建提供稠密监督,尤其在观察不足的区域。迭代反馈环路使 3D 几何与 2D 视图合成相互影响,提升场景重建与生成视图的质量。结果是从稀疏输入下无需任何场景特定训练或微调即可获得连贯、高保真渲染。在 LLFF、DTU、DL3DV 和 MipNeRF-360 上,该方法在极端稀疏条件下显著优于强大的 3D-GS 基线。

关键词

引用

@article{arxiv.2511.17932,
  title  = {Novel View Synthesis from A Few Glimpses via Test-Time Natural Video Completion},
  author = {Yan Xu and Yixing Wang and Stella X. Yu},
  journal= {arXiv preprint arXiv:2511.17932},
  year   = {2025}
}

备注

Accepted to NeurIPS 2025