类似主体的文本到图像合成的自交扩散引导
计算机视觉与模式识别
2025-03-26 v2
摘要
扩散模型在合成图像、视频、3D 资产等方面实现了空前的保真度和多样性。然而,主体混合是扩散图像合成中未解决的问题,尤其是针对合成多个外观相似的主体。我们提出了自交扩散引导,以惩罚交叉注意力图与聚合自注意力图之间的重叠。与仅基于自注意力或交叉注意力的先前方法相比,我们的引导方法在消除主体混合方面更有效。此外,我们的引导方法针对所有相关 patch,而不仅仅是最具辨识度的 patch(例如鸟的喙)进行主体混合处理。对于每个主体,我们聚合交叉注意力值较高的 patch 的自注意力图。因此,聚合的自注意力图形成一个整个主体所关注的区域。我们的方法无需训练,能够提升基于 Unet 和 Transformer 的扩散模型的性能,如 Stable Diffusion 系列。我们还发布了一个类似主体数据集(SSD),这是一个具有挑战性的基准测试,并利用 GPT-4o 进行自动可靠的评估。大量的定性和定量结果表明,我们的自交扩散引导方法有效。
引用
@article{arxiv.2411.18936,
title = {Self-Cross Diffusion Guidance for Text-to-Image Synthesis of Similar Subjects},
author = {Weimin Qiu and Jieke Wang and Meng Tang},
journal= {arXiv preprint arXiv:2411.18936},
year = {2025}
}
备注
Conference on Computer Vision and Pattern Recognition (CVPR), 2025