学习空间感知以改善人群计数
计算机视觉与模式识别
2019-09-17 v1
摘要
人群计数的目标是通过利用行人头部中心位置的标注来估计图像中的人数。随着深度卷积神经网络的普及,该领域已取得可喜进展。现有方法广泛采用欧氏距离(即 损失)来优化模型,然而其存在两个主要缺陷:(1)该损失难以学习空间感知(即头部位置),因为它难以保留密度图中的高频变化;(2)该损失对人群计数中的各类噪声高度敏感,例如零均值噪声、头部尺寸变化以及遮挡。尽管先前提出的子阵列最大超出损失(MESA loss)通过寻找预测密度图与真实值差异最大的矩形子区域来解决上述问题,但其无法用梯度下降求解,因而难以集成到深度学习框架中。本文提出一种称为空间感知网络(SPANet)的新颖架构,以引入空间上下文用于人群计数。为此提出像素最大超出损失(MEP loss),通过寻找与真实值差异较大的像素级子区域来实现该目标。为此,我们设计了一种弱监督学习方案,以多分支架构生成此类区域。所提框架可集成到现有深度人群计数方法中,并支持端到端训练。在四个具挑战性基准上的大量实验表明,我们的方法能显著提升基线的性能。更值得注意的是,我们的方法在所有基准数据集上均优于当前最优(state-of-the-art)方法。
引用
@article{arxiv.1909.07057,
title = {Learning Spatial Awareness to Improve Crowd Counting},
author = {Zhi-Qi Cheng and Jun-Xiu Li and Qi Dai and Xiao Wu and Alexander Hauptmann},
journal= {arXiv preprint arXiv:1909.07057},
year = {2019}
}
备注
ICCV 2019 Oral