中文

放眼全局:基于全景图与视频扩散的两阶段场景视图生成

计算机视觉与模式识别 2025-09-03 v1 人工智能

摘要

从单张图像进行新视角合成(NVS)由于存在大量未观测区域而具有高度不适定性,尤其对于与输入视角偏差较大的视图。现有方法侧重于源视图与生成视图之间的一致性,但在长距离或循环轨迹上往往无法保持连贯性和正确的视角对齐。我们提出一个模型,通过将单视图NVS分解为360度场景外推和新视角插值来解决此问题。该设计通过以从生成的全景表示中提取并变形的关键帧为条件,确保了长程视图和场景的一致性。在第一阶段,全景扩散模型从输入透视图像中学习场景先验。然后从全景图中采样透视关键帧并进行变形,将其用作预训练视频扩散模型中的锚定帧,该模型通过所提出的空间噪声扩散过程生成新视角。与先前工作相比,我们的方法即使在闭环场景下也能生成全局一致的新视角,同时实现灵活的相机控制。在多样化场景数据集上的实验表明,我们的方法在沿用户定义轨迹生成连贯视图方面优于现有方法。我们的实现代码可在https://github.com/YiGuYT/LookBeyond获取。

关键词

引用

@article{arxiv.2509.00843,
  title  = {Look Beyond: Two-Stage Scene View Generation via Panorama and Video Diffusion},
  author = {Xueyang Kang and Zhengkang Xiang and Zezheng Zhang and Kourosh Khoshelham},
  journal= {arXiv preprint arXiv:2509.00843},
  year   = {2025}
}

备注

26 pages, 30 figures, 2025 ACM Multimedia