中文

CountCluster:基于跨注意力图聚类的训练-free 对象数量引导方法用于文本到图像生成

计算机视觉与模式识别 2026-01-06 v2

摘要

扩散式文本到图像生成模型在图像质量和多样性方面表现出色,但仍难以准确反映输入提示中指定的对象数量。已提出若干方法依赖外部计数模块进行迭代细化,或基于学习标记或潜在特征派生的数量表示。然而,这些方法在准确反映指定对象数量方面仍有局限,同时忽视了一个重要结构特征——生成图像中对象实例的数量在去噪过程的早期阶段就基本决定。为正确反映图像生成的物体数量,早期时步中对象跨注意力图的高度激活区域应匹配输入的物体数量,且每个区域应清晰分离。为此,我们提出了 \textit{CountCluster},一种无需依赖任何外部工具或额外训练即可引导对象跨注意力图按指定对象数量进行聚类的方法。该方法在推断时基于注意力得分将对象跨注意力图划分为 kk 个聚类,定义理想分布以确保每个聚类在空间上清晰分离,并优化潜在变量以匹配该目标分布。我们的方法在对象计数精度上比现有方法平均提高 18.5\%p,在多种提示下展现出优异的数量控制性能。代码将在 https://github.com/JoohyeonL22/CountCluster 发布。

关键词

引用

@article{arxiv.2508.10710,
  title  = {CountCluster: Training-Free Object Quantity Guidance with Cross-Attention Map Clustering for Text-to-Image Generation},
  author = {Joohyeon Lee and Jin-Seop Lee and Jee-Hyong Lee},
  journal= {arXiv preprint arXiv:2508.10710},
  year   = {2026}
}

备注

Under review