基于上下文建模的半监督人群计数:促进对人群场景的整体理解
计算机视觉与模式识别
2024-04-23 v3
摘要
为减轻训练可靠人群计数模型的繁重标注负担,从而通过利用更多数据使模型更实用且更准确,本文提出一种基于 mean teacher 框架的新半监督方法。当可用标注数据稀缺时,模型易对局部图像块过拟合。在此类情形下,仅通过无标注数据提升局部块预测准确性的常规方法显得不足。因此,我们提出一种更精细的思路:培养模型内在的“subitizing(瞬时计数)”能力。该能力使模型借助对人群场景的理解准确估计区域人数,类似于人类认知过程。为实现此目标,我们对无标注数据施加掩码,引导模型基于整体线索对这些掩码块进行预测。此外,为辅助特征学习,我们引入细粒度密度分类任务。我们的方法具有通用性,可应用于大多数现有人群计数方法,因其无严格的结构或损失约束。另外,我们观察到用本框架训练的模型表现出类“subitizing”行为:仅“一瞥”即可准确预测低密度区域,同时结合局部细节预测高密度区域。我们的方法取得了最优性能,在 ShanghaiTech A 和 UCF-QNRF 等具挑战性基准上大幅超越先前方法。代码见:https://github.com/cha15yq/MRC-Crowd。
引用
@article{arxiv.2310.10352,
title = {Semi-Supervised Crowd Counting with Contextual Modeling: Facilitating Holistic Understanding of Crowd Scenes},
author = {Yifei Qian and Xiaopeng Hong and Zhongliang Guo and Ognjen Arandjelović and Carl R. Donovan},
journal= {arXiv preprint arXiv:2310.10352},
year = {2024}
}
备注
Accepted by TCSVT