中文

基于多分辨率融合与多尺度输入先验的 crowd counting(人群计数)

计算机视觉与模式识别 2020-10-06 v1 机器学习

摘要

由于巨大的人群密度变化、较大的透视改变、严重的遮挡以及多变的光照条件,静态图像中的人群计数在实践中是一个具有挑战性的问题。基于最先进的块重缩放模块(PRM)的方法被证明在改善人群计数性能方面非常有效。然而,PRM 模块需要额外且折中的人群密度分类过程。为解决这些问题与挑战,本文提出了一种新的基于多分辨率融合的端到端人群计数网络。它采用三个基于深层的列/分支,各自应对相应的人群密度尺度。这些列定期相互融合(共享)信息。该网络分为三个阶段,每个阶段包含一个或多个列。引入了三个输入先验,作为 PRM 模块的高效且有效的替代方案,无需任何额外的分类操作。除最终的人群计数回归头外,该网络还包含三个辅助人群估计回归头,它们被策略性地放置于每个阶段末端以提升整体性能。在三个基准数据集上的综合实验表明,所提方法在 RMSE 评估指标下优于所有最先进模型。所提方法还具有更好的泛化能力,在跨数据集实验中取得了最佳结果。

关键词

引用

@article{arxiv.2010.01664,
  title  = {Multi-Resolution Fusion and Multi-scale Input Priors Based Crowd Counting},
  author = {Usman Sajid and Wenchi Ma and Guanghui Wang},
  journal= {arXiv preprint arXiv:2010.01664},
  year   = {2020}
}