中文

GenWarp:基于保持语义的生成式扭曲的单图像新视角合成

计算机视觉与模式识别 2024-09-27 v2

摘要

由于 3D 场景的复杂性以及现有用于训练模型的多视图数据集的多样性有限,从单张图像生成新视角仍然是一项具有挑战性的任务。最近将大规模文本到图像(T2I)模型与单目深度估计(MDE)相结合的研究在处理野外图像方面展现出了前景。在这些方法中,输入视图通过估计的深度图在几何上被扭曲为新视角,然后扭曲后的图像由 T2I 模型进行修复。然而,当将输入视图扭曲到新视角时,它们在处理含噪深度图和语义细节丢失方面存在困难。在本文中,我们提出了一种用于单次新视角合成的新方法,这是一种保持语义的生成式扭曲框架,通过用自注意力增强跨视图注意力,使 T2I 生成模型能够学习在哪里扭曲以及在哪里生成。我们的方法通过以源视图图像为生成模型的条件并结合几何扭曲信号,解决了现有方法的局限性。定性和定量评估表明,我们的模型在域内和域外场景中均优于现有方法。项目页面可在 https://GenWarp-NVS.github.io/ 获取。

关键词

引用

@article{arxiv.2405.17251,
  title  = {GenWarp: Single Image to Novel Views with Semantic-Preserving Generative Warping},
  author = {Junyoung Seo and Kazumi Fukuda and Takashi Shibuya and Takuya Narihira and Naoki Murata and Shoukang Hu and Chieh-Hsin Lai and Seungryong Kim and Yuki Mitsufuji},
  journal= {arXiv preprint arXiv:2405.17251},
  year   = {2024}
}

备注

Accepted to NeurIPS 2024 / Project page: https://GenWarp-NVS.github.io