中文

YOLO-Count:用于文本到图像生成的可微对象计数

计算机视觉与模式识别 2025-08-04 v1

摘要

我们提出了 YOLO-Count,一种可微的开放词汇对象计数模型,既解决一般计数挑战,又可实现对文本到图像(T2I)生成的精确数量控制。核心贡献是“基数”图,这一新型回归目标考虑对象尺寸和空间分布的变化。利用表示对齐和混合强弱监督方案,YOLO-Count 在桥接开放词汇计数与 T2I 生成控制之间发挥作用。其完全可微的架构支持梯度优化,实现准确的对象计数估计和生成模型的精细引导。大量实验表明,YOLO-Count 在实现最先进计数精度的同时,为 T2I 系统提供了稳健且有效的数量控制。

关键词

引用

@article{arxiv.2508.00728,
  title  = {YOLO-Count: Differentiable Object Counting for Text-to-Image Generation},
  author = {Guanning Zeng and Xiang Zhang and Zirui Wang and Haiyang Xu and Zeyuan Chen and Bingnan Li and Zhuowen Tu},
  journal= {arXiv preprint arXiv:2508.00728},
  year   = {2025}
}

备注

ICCV 2025