中文

AutoScale:用于人群计数与定位的学习缩放方法

计算机视觉与模式识别 2021-10-20 v4

摘要

近期人群计数工作主要利用CNN通过回归密度图进行计数,并取得了很大进展。在密度图中,每个人由一个高斯斑表示,最终计数由整张图的积分获得。然而,在密集区域准确预测密度图是困难的。一个主要问题是密集区域上的密度图通常累积了多个邻近高斯斑的密度值,从而在少量像素上产生不同的大密度值。这使得密度图呈现变异模式并伴随显著的图案偏移,且带来像素级密度值的长尾分布。我们提出一个简单有效的学习缩放(L2S)模块,其自动将密集区域缩放到合理的邻近度水平(反映相邻人之间的像平面距离)。L2S直接归一化不同块中的邻近度,从而动态分离重叠斑、分解真值密度图中的累积值,进而缓解图案偏移与密度值的长尾分布。这有助于模型更好地学习密度图。我们还探索了L2S通过寻找量化距离(相对于人位置图)的局部极小值来进行人员定位的有效性。据我们所知,这种定位方法在基于定位的人群计数中也是新颖的。我们进一步引入定制的动态交叉熵损失,显著改进了基于定位的模型优化。大量实验表明,所提出的称为AutoScale的框架在三个拥挤数据集的回归与定位基准上优于一些最先进方法,并在两个稀疏数据集上取得极具竞争力的性能。

关键词

引用

@article{arxiv.1912.09632,
  title  = {AutoScale: Learning to Scale for Crowd Counting and Localization},
  author = {Chenfeng Xu and Dingkang Liang and Yongchao Xu and Song Bai and Wei Zhan and Xiang Bai and Masayoshi Tomizuka},
  journal= {arXiv preprint arXiv:1912.09632},
  year   = {2021}
}

备注

This work is accepted by IJCV. Code is available at \url{https://github.com/dk-liang/AutoScale.git}