中文

Aerial Diffusion:基于扩散模型利用文本引导从单幅图像进行地面到空中视角转换

计算机视觉与模式识别 2023-10-04 v2

摘要

我们提出一种新方法 Aerial Diffusion,利用文本引导从单幅地面视角图像生成空中视角。Aerial Diffusion 借助预训练的文本-图像扩散模型获取先验知识。我们解决了两个主要挑战:地面视角与空中视角之间的域差距,以及两视角在文本-图像嵌入流形中相距甚远。我们的方法在微调预训练扩散模型之前,使用受逆透视映射启发的单应性。此外,利用对应地面视角的文本微调模型,有助于我们以相对较低的偏向地面视角图像的方式捕获地面视角图像中的细节。Aerial Diffusion 采用交替采样策略在复杂高维流形上计算最优解并生成高保真度(相对于地面视角)的空中图像。我们在来自自然、人类动作、室内场景等多种领域的大量图像上展示了 Aerial Diffusion 的质量与通用性。我们通过广泛的消融与对比定性证明了方法的有效性。据我们所知,Aerial Diffusion 是首个以无监督方式执行地面到空中转换的方法。

关键词

引用

@article{arxiv.2303.11444,
  title  = {Aerial Diffusion: Text Guided Ground-to-Aerial View Translation from a Single Image using Diffusion Models},
  author = {Divya Kothandaraman and Tianyi Zhou and Ming Lin and Dinesh Manocha},
  journal= {arXiv preprint arXiv:2303.11444},
  year   = {2023}
}

备注

Code: https://github.com/divyakraman/AerialDiffusion