TCFormer:基于密度引导聚合的 500 万参数弱监督人群计数 Transformer
计算机视觉与模式识别
2025-12-30 v1 人工智能
摘要
人群计数通常依赖耗时的点级标注和计算密集的 backbone,限制了其在资源受限环境中的可扩展性和部署。为解决这些挑战,本文提出了 TCFormer,一个仅需 500 万参数的微型、超轻量级、基于 Transformer 的弱监督人群计数框架,实现了与竞争水平的性能。首先,采用一个强大而高效的视觉 Transformer 作为特征提取器,其全球感知上下文能力在最小内存占用下提供语义意义上的人群特征。其次,为弥补空间监督不足,设计了称为可学习密度加权平均模块的特征聚合机制。该模块根据预测密度得分动态重新加权局部 token,使网络能够在无需额外标注的情况下根据其特定密度特征自适应调制区域特征。此外,本文引入密度级分类损失,将人群密度离散化为 distinct 等级,从而正则化训练过程并增强模型在不同密度水平上的分类能力。因此,尽管 TCFormer 在仅使用图像级全局计数的弱监督范式下训练,count 和密度级损失的联合优化仍使该框架实现了高估计精度。在包括 ShanghaiTech A/B、UCF-QNRF 和 NWPU 数据集在内的四个基准上的大量实验表明,我们的方法在参数效率和计数精度之间实现了卓越的折中,能够为资源受限设备上的人群计数任务提供优异解决方案。
引用
@article{arxiv.2512.22203,
title = {TCFormer: A 5M-Parameter Transformer with Density-Guided Aggregation for Weakly-Supervised Crowd Counting},
author = {Qiang Guo and Rubo Zhang and Bingbing Zhang and Junjie Liu and Jianqing Liu},
journal= {arXiv preprint arXiv:2512.22203},
year = {2025}
}