中文

CountDiffusion: 基于免训练计数引导扩散的文本到图像合成

计算机视觉与模式识别 2025-05-08 v1

摘要

Stable Diffusion 推动了文本到图像合成的发展,但由于高昂的计算成本以及向模型教授数量这一抽象概念的挑战,训练模型生成具有准确物体数量的图像仍然困难。在本文中,我们提出了 CountDiffusion,这是一个免训练框架,旨在从文本描述中生成具有正确物体数量的图像。CountDiffusion 包含两个阶段。在第一阶段,通过扩散模型进行一步去噪生成中间去噪结果,以预测最终合成的图像,并使用计数模型计算该图像中的物体数量。在第二阶段,使用校正模块通过通用引导改变物体的注意力图来校正物体数量。所提出的 CountDiffusion 可以无需进一步训练即插入任何基于扩散的文本到图像 (T2I) 生成模型中。实验结果证明了我们提出的 CountDiffusion 的优越性,大幅提升了 T2I 模型生成准确物体数量的能力。

关键词

引用

@article{arxiv.2505.04347,
  title  = {CountDiffusion: Text-to-Image Synthesis with Training-Free Counting-Guidance Diffusion},
  author = {Yanyu Li and Pencheng Wan and Liang Han and Yaowei Wang and Liqiang Nie and Min Zhang},
  journal= {arXiv preprint arXiv:2505.04347},
  year   = {2025}
}

备注

8 pages, 9 figures, 3 tables