中文

通过文本到图像扩散模型定制 360 度全景图

计算机视觉与模式识别 2023-11-09 v2

摘要

基于扩散模型的个性化文本到图像(T2I)合成近期引起了研究的广泛关注。然而,现有方法主要集中于定制主体或风格,忽视了对全局几何的探索。在本研究中,我们提出一种方法,利用 T2I 扩散模型专注于具有内在全局几何属性的 360 度全景图的定制。为此,我们专门为该任务策划了一个配对图像-文本数据集,随后使用它通过 LoRA 微调预训练的 T2I 扩散模型。然而,仅靠微调模型无法保证合成图像最左侧与最右侧之间的连续性,而这是 360 度全景图的关键特征。为解决此问题,我们提出一种称为 StitchDiffusion 的方法。具体而言,我们在由最左和最右图像区域组成的拼接块上,于去噪过程的每个时间步执行两次预去噪操作。此外,采用全局裁剪来合成无缝的 360 度全景图。实验结果证明了我们的定制模型结合所提 StitchDiffusion 在生成高质量 360 度全景图像方面的有效性。而且,我们的定制模型在生成微调数据集中未出现的场景时展现出卓越的泛化能力。代码见 https://github.com/littlewhitesea/StitchDiffusion。

关键词

引用

@article{arxiv.2310.18840,
  title  = {Customizing 360-Degree Panoramas through Text-to-Image Diffusion Models},
  author = {Hai Wang and Xiaoyu Xiang and Yuchen Fan and Jing-Hao Xue},
  journal= {arXiv preprint arXiv:2310.18840},
  year   = {2023}
}

备注

Accepted by WACV 2024, Project Page: https://littlewhitesea.github.io/stitchdiffusion.github.io/