PiCo:通过改进的噪声选择和精确的掩码控制增强扩散模型中的文本-图像对齐
计算机视觉与模式识别
2025-05-07 v1
摘要
先进的扩散模型在文本到图像的组合生成方面取得了显著进展。然而,当面对复杂的文本提示时,现有模型要实现文本-图像对齐仍然是一个挑战。在这项工作中,我们强调了影响这种对齐的两个因素:随机初始化噪声的质量和生成的控制掩码的可靠性。然后,我们提出了PiCo(Pick-and-Control),这是一种新颖的免训练方法,包含两个关键组件来解决这两个因素。首先,我们开发了一个噪声选择模块来评估随机噪声的质量,并确定该噪声是否适合目标文本。我们利用快速采样策略来确保噪声选择阶段的效率。其次,我们引入了一个参考掩码模块来生成像素级掩码,并精确地调制交叉注意力图。我们将参考掩码应用于标准扩散过程,以引导文本和图像特征之间的合理交互。我们进行了大量实验来验证PiCo的有效性,它可以将用户从繁琐的随机生成过程中解放出来,并增强针对多样化文本描述的文本-图像对齐。
引用
@article{arxiv.2505.03203,
title = {PiCo: Enhancing Text-Image Alignment with Improved Noise Selection and Precise Mask Control in Diffusion Models},
author = {Chang Xie and Chenyi Zhuang and Pan Gao},
journal= {arXiv preprint arXiv:2505.03203},
year = {2025}
}