中文

广域人群计数:用于大场景计数的多视角融合网络

计算机视觉与模式识别 2022-05-03 v2

摘要

单视角图像中的人群计数在现有计数数据集上已取得优异性能。然而,单视角计数不适用于大型宽广场景(如公共公园、长地铁站台或活动空间),因为单个相机无法以足够细节捕捉整个场景用于计数,例如当场景过大无法纳入相机视场、过长导致远处人群分辨率过低,或存在过多大型物体遮挡大部分人群时。因此,解决广域计数任务需要具有重叠视场的多个相机。本文提出一种用于多视角人群计数的深度神经网络框架,其融合来自多个相机视角的信息以预测3D世界地平面上的场景级密度图。我们考虑三种融合框架版本:晚期融合模型融合相机视角密度图;朴素早期融合模型融合相机视角特征图;多视角多尺度早期融合模型确保对齐到同一地平面点的特征具有一致尺度。旋转选择模块进一步确保特征旋转对齐的一致性。我们在三个多视角计数数据集PETS2009、DukeMTMC以及一个新收集的包含拥挤街道交叉口的多视角计数数据集上测试了三种融合模型。与其他多视角计数基线相比,我们的方法取得了最先进的结果。

关键词

引用

@article{arxiv.2012.00946,
  title  = {Wide-Area Crowd Counting: Multi-View Fusion Networks for Counting in Large Scenes},
  author = {Qi Zhang and Antoni B. Chan},
  journal= {arXiv preprint arXiv:2012.00946},
  year   = {2022}
}

备注

Accepted to IJCV