用于高保真文本到图像合成的数量引导
计算机视觉与模式识别
2025-03-06 v3
摘要
近来,文本到图像生成的质量和性能取得了显著进步,这主要归功于扩散模型所取得的令人印象深刻的成果。然而,文本到图像扩散模型有时难以为给定输入提示创建高保真内容。一个具体问题是它们难以生成文本提示中指定的精确物体数量。例如,当提供提示“桌上有五个苹果和十个柠檬”时,扩散模型生成的图像通常包含不正确数量的物体。在本文中,我们提出一种改进扩散模型的方法,使其能根据输入提示准确生成正确的物体计数。我们采用一个对任意给定图像执行无参考、类别无关计数的计数网络。我们计算计数网络的梯度并 refinement 每步的预测噪声。为解决提示中存在多种物体的问题,我们利用新颖的注意力图引导为每种物体获取高质量掩码。最后,我们使用为每种物体计算的梯度引导去噪过程。通过大量实验与评估,我们证明所提方法显著增强了扩散模型在物体计数方面的保真度。代码见 https://github.com/furiosa-ai/counting-guidance。
引用
@article{arxiv.2306.17567,
title = {Counting Guidance for High Fidelity Text-to-Image Synthesis},
author = {Wonjun Kang and Kevin Galim and Hyung Il Koo and Nam Ik Cho},
journal= {arXiv preprint arXiv:2306.17567},
year = {2025}
}
备注
Accepted at WACV 2025 (Oral). Code is available at https://github.com/furiosa-ai/counting-guidance