用于语义一致全景图的扩散路径合并与分割
计算机视觉与模式识别
2024-08-29 v1
摘要
扩散模型已成为文本到图像生成的前沿技术,越来越多的研究致力于适配预训练扩散模型的推理过程以实现零样本能力。其中一种方法是通过组合独立的扩散路径来生成全景图像,这种方法被称为联合扩散(joint diffusion),能够获得感知上对齐的全景图像。然而,这些方法常常产生语义不一致的输出,牺牲了多样性以换取一致性。为克服这一限制,我们提出了Merge-Attend-Diffuse算子,可插入到各种预训练扩散模型中,用于联合扩散设置,以提高生成全景图像的感知和语义一致性。具体而言,我们合并扩散路径,重新编程自注意力和交叉注意力机制,以 operate on the aggregated latent space。大量定量和定性实验分析,结合用户研究,表明我们的方法在保持输入提示和生成图像视觉质量的同时,显著提升了语义一致性。我们将在 https://github.com/aimagelab/MAD 上发布代码。
引用
@article{arxiv.2408.15660,
title = {Merging and Splitting Diffusion Paths for Semantically Coherent Panoramas},
author = {Fabio Quattrini and Vittorio Pippi and Silvia Cascianelli and Rita Cucchiara},
journal= {arXiv preprint arXiv:2408.15660},
year = {2024}
}
备注
Accepted at ECCV 2024