驯服 Stable Diffusion 以实现文本到 360 度全景图像生成
计算机视觉与模式识别
2024-04-12 v1
摘要
生成模型(例如 Stable Diffusion)已经能够根据文本提示创建逼真的图像。然而,从文本生成 360 度全景图像仍然是一个挑战,这主要是由于缺乏成对的文本-全景数据以及全景图像与透视图像之间的领域差异。在本文中,我们引入了一种名为 PanFusion 的双分支扩散模型,以从文本提示生成 360 度图像。我们利用 Stable Diffusion 模型作为一个分支,以提供自然图像生成中的先验知识,并将其配准到另一个全景分支以进行整体图像生成。我们提出了一种具有投影感知的独特交叉注意力机制,以在协作去噪过程中最小化失真。我们的实验验证了 PanFusion 超越了现有方法,并且得益于其双分支结构,可以集成诸如房间布局等额外约束,以实现定制化的全景输出。代码可在 https://chengzhag.github.io/publication/panfusion 获取。
引用
@article{arxiv.2404.07949,
title = {Taming Stable Diffusion for Text to 360{\deg} Panorama Image Generation},
author = {Cheng Zhang and Qianyi Wu and Camilo Cruz Gambardella and Xiaoshui Huang and Dinh Phung and Wanli Ouyang and Jianfei Cai},
journal= {arXiv preprint arXiv:2404.07949},
year = {2024}
}
备注
CVPR 2024. Project Page: https://chengzhag.github.io/publication/panfusion Code: https://github.com/chengzhag/PanFusion