中文

基于弱监督学习的CNN与Transformer联合网络用于高效人群计数

计算机视觉与模式识别 2022-03-15 v1

摘要

当前,针对人群计数,通过密度图估计的全监督方法是主流研究方向。然而,此类方法需要图像中行人的位置级标注,耗时费力。因此,仅依赖计数级标注的弱监督方法亟待发展。由于CNN不适合建模全局上下文及图像块间的交互,基于CNN的弱监督学习人群计数通常表现不佳。基于Transformer的弱监督模型随后被提出以建模全局上下文并学习对比特征。然而,Transformer直接将人群图像划分为一系列token,由于每个行人是独立个体,这可能并非良策,且网络参数量极大。故此,本文提出一种基于弱监督学习的CNN与Transformer联合网络(JCTNet)用于人群计数。JCTNet由三部分组成:CNN特征提取模块(CFM)、Transformer特征提取模块(TFM)和计数回归模块(CRM)。特别地,CFM提取人群语义信息特征,随后将其图像块划分送入TFM建模全局上下文,CRM用于预测人数。大量实验与可视化表明,JCTNet能有效聚焦于人群区域,并在五个主流数据集上取得优越的弱监督计数性能。相较纯Transformer工作,模型参数量可减少约67%~73%。我们也尝试解释仅受计数级标注约束的模型仍能聚焦人群区域的现象。我们相信本工作能推动该领域的进一步研究。

关键词

引用

@article{arxiv.2203.06388,
  title  = {Joint CNN and Transformer Network via weakly supervised Learning for efficient crowd counting},
  author = {Fusen Wang and Kai Liu and Fei Long and Nong Sang and Xiaofeng Xia and Jun Sang},
  journal= {arXiv preprint arXiv:2203.06388},
  year   = {2022}
}