中文

基于 DDIM 反向变换的新颖视图合成

计算机视觉与模式识别 2026-01-09 v2

摘要

从单张输入图像合成新视图是一项具有挑战性的任务。它需要在推断遮挡区域细节的同时,对场景的三维结构进行外推,并在不同视点之间保持几何一致性。许多现有方法需要通过多视角微调大型扩散模型或从头训练扩散模型,这代价极高。此外,这些方法还受益于重建模糊和泛化性差的限制。这种差距为探索一种能够直接利用预训练扩散模型高保真生成能力、同时从新视角重建场景的轻量级视图转换框架提供了机会。给定单张输入图像的 DDIM 反向变换潜在表示,我们采用基于相机姿态条件的翻译 U-Net(TUNet)来预测达到所需目标视角的反向变换潜在表示。然而,使用预测后的潜在表示采样生成的图像可能导致重建模糊。为此,我们提出了一种新颖的融合策略,利用 DDIM 反向变换中观察到的固有噪声相关结构。该融合策略有助于保留纹理和细粒度细节。为合成新视图,我们将融合后的潜在表示作为 DDIM 采样的初始条件,利用预训练扩散模型的生成先验。大量实验表明,我们的方法在 MVImgNet 上的表现优于现有方法。

关键词

引用

@article{arxiv.2508.10688,
  title  = {Novel View Synthesis using DDIM Inversion},
  author = {Sehajdeep Singh and A V Subramanyam and Aditya Gupta and Sahil Gupta},
  journal= {arXiv preprint arXiv:2508.10688},
  year   = {2026}
}