解构扩散模型中的数目感知——局限性与补救措施
计算机视觉与模式识别
2025-10-14 v1
摘要
数目感知是文本到图像生成模型(如 FLUX 和 GPT-4o)的一个持续挑战,这些模型常常无法准确遵循文本提示中的计数指令。本文旨在研究一个基本却常被忽视的问题:通过扩大数据集和模型规模,扩散模型能否本质上生成正确数量的物体?为实现严谨且可重复的评估,我们构建了一个干净的合成数目感知基准,包含两个互补数据集:用于受控扩缩放研究的 GrayCount250,以及具有复杂自然场景的 NaturalCount6。其次,我们实证表明,扩大模型和数据集本身并不能提升基准上的计数准确度。我们的分析识别出关键原因:扩散模型倾向于依赖噪声初始化,而非文本提示中明确指定的数目。我们观察到噪声先验对特定物体计数存在偏见。此外,我们提出一种有效策略,通过注入计数感知的布局信息到噪声先验中来控制数目。我们的方法显著提升了准确度:在 GrayCount250 上从 20.0% 提升至 85.3%,在 NaturalCount6 上从 74.8% 提升至 86.3%,显示出在不同情境下的有效泛化能力。
引用
@article{arxiv.2510.11117,
title = {Demystifying Numerosity in Diffusion Models -- Limitations and Remedies},
author = {Yaqi Zhao and Xiaochen Wang and Li Dong and Wentao Zhang and Yuhui Yuan},
journal= {arXiv preprint arXiv:2510.11117},
year = {2025}
}