探究基于 Stable Diffusion 的文本到 360 度全景图生成的关键因素
计算机视觉与模式识别
2025-05-29 v1
摘要
文本到图像扩散模型(如 Stable Diffusion)的近期繁荣,激发了将其适配于 360 度全景图生成的研究。先前的工作已经证明了在预训练扩散模型上使用常规低秩适配技术生成全景图像的可行性。然而,透视图像与全景图像之间巨大的领域差距引发了关于实现这一经验成功的底层机制的疑问。我们假设并检验了可训练部分在全景数据上微调时表现出不同的行为,并且这种适配隐藏了某种利用预训练扩散模型内先验知识的内在机制。我们的分析揭示了以下几点:1) 注意力模块中的 query 和 key 矩阵负责全景领域与透视领域之间可共享的通用信息,因此与全景图生成的相关性较低;2) value 和 output 权重矩阵专用于将预训练知识适配至全景领域,在全景图生成的微调过程中发挥着更关键的作用。我们通过引入一个名为 UniPano 的简单框架来实证验证这些见解,旨在为未来研究确立一个优雅的基线。UniPano 不仅优于现有方法,而且与先前的双分支方法相比,显著降低了内存使用和训练时间,使其能够扩展到更高分辨率的端到端全景图生成。代码将开源。
引用
@article{arxiv.2505.22129,
title = {What Makes for Text to 360-degree Panorama Generation with Stable Diffusion?},
author = {Jinhong Ni and Chang-Bin Zhang and Qiang Zhang and Jing Zhang},
journal= {arXiv preprint arXiv:2505.22129},
year = {2025}
}