YOLO-Count:用于文本到图像生成的可微对象计数
计算机视觉与模式识别
2025-08-04 v1
摘要
我们提出了 YOLO-Count,一种可微的开放词汇对象计数模型,既解决一般计数挑战,又可实现对文本到图像(T2I)生成的精确数量控制。核心贡献是“基数”图,这一新型回归目标考虑对象尺寸和空间分布的变化。利用表示对齐和混合强弱监督方案,YOLO-Count 在桥接开放词汇计数与 T2I 生成控制之间发挥作用。其完全可微的架构支持梯度优化,实现准确的对象计数估计和生成模型的精细引导。大量实验表明,YOLO-Count 在实现最先进计数精度的同时,为 T2I 系统提供了稳健且有效的数量控制。
关键词
引用
@article{arxiv.2508.00728,
title = {YOLO-Count: Differentiable Object Counting for Text-to-Image Generation},
author = {Guanning Zeng and Xiang Zhang and Zirui Wang and Haiyang Xu and Zeyuan Chen and Bingnan Li and Zhuowen Tu},
journal= {arXiv preprint arXiv:2508.00728},
year = {2025}
}
备注
ICCV 2025