球面稠密文本到图像合成
计算机视觉与模式识别
2025-03-12 v3
摘要
最近的文本到图像(T2I)技术在合成结果方面取得了显进步,但在布局控制和生成全向全景图像方面仍面临挑战。稠密 T2I(DT2I)和球面 T2I(ST2I)模型针对这些问题提供了解决方案,但迄今为止尚无统一方法。诸如要求 DT2I 模型生成全景图像之类的简单方法无法生成proper spherical distortions以及在边界处的无缝过渡。我们的方法表明,通过将训练-free DT2I 方法集成到微调的全景模型中,可以实现球面稠密文本到图像(SDT2I)。具体而言,我们提出了通过将 MultiDiffusion 集成到 StitchDiffusion 和 PanFusion 中的 MultiStitchDiffusion(MSTD)和 MultiPanFusion(MPF)。由于目前尚无 SDT2I 的基准测试,我们进一步构建了 Dense-Synthetic-View(DSynView),一个包含球面布局的新型合成数据集,用于评估我们的模型。我们的结果表明,MSTD 在图像质量以及提示和布局遵循方面均优于 MPF。MultiPanFusion 生成的图像更具多样性,但在合成无瑕的前景对象方面存在挑战。我们提出了 bootstrap-coupling 以及关闭等距矩形透视投影注意力于前景作为 MPF 的改进措施。链接 https://github.com/sdt2i/spherical-dense-text-to-image
关键词
引用
@article{arxiv.2502.12691,
title = {Spherical Dense Text-to-Image Synthesis},
author = {Timon Winter and Stanislav Frolov and Brian Bernhard Moser and Andreas Dengel},
journal= {arXiv preprint arXiv:2502.12691},
year = {2025}
}
备注
Link to project page https://sdt2i.github.io/