CoCoNO:用于文本到图像合成中的初始噪声优化的注意力对比与补全
计算机视觉与模式识别
2024-11-27 v1
摘要
尽管近期在文本到图像模型方面取得了进展,但在文本到图像扩散模型中实现语义准确的图像仍是一个持续的挑战。虽然现有的初始潜在优化方法已展现出令人印象深刻的性能,但我们发现了两个关键局限性:(a) 注意力忽略,合成的图像因某些主体在自注意力图中没有指定片段而被遗漏,尽管这些主体在高响应的交叉注意力中表现突出;(b) 注意力干扰,生成的图像因不同主体的交叉注意力图和自注意力图之间的冲突重叠而产生混合属性。为解决这些局限性,我们引入了CoCoNO,这是一个通过利用自注意力图和交叉注意力图之间互补信息来优化初始潜在的新算法。我们的方法引入了两个新的损失函数:注意力对比损失,通过确保每个自注意力片段仅与特定主体的交叉注意力图相关联,从而最小化不必要的重叠;注意力补全损失,通过最大化这些片段的激活,确保每个主体被完整且清晰地表示。我们的 method 采用噪声优化框架,无需重新训练基础模型。通过在多个基准上的大量实验,我们展示了CoCoNO显著改善了文本-图像对齐,并超过了当前最先进的技术。
引用
@article{arxiv.2411.16783,
title = {CoCoNO: Attention Contrast-and-Complete for Initial Noise Optimization in Text-to-Image Synthesis},
author = {Aravindan Sundaram and Ujjayan Pal and Abhimanyu Chauhan and Aishwarya Agarwal and Srikrishna Karanam},
journal= {arXiv preprint arXiv:2411.16783},
year = {2024}
}
备注
15 pages, 12 figures