中文

FGENet:面向拥挤人群计数的细粒度提取网络

计算机视觉与模式识别 2024-01-03 v1

摘要

人群计数因其实际应用而广受欢迎。然而,主流计数方法忽略了精确的个体定位,并且由于通过估计密度图进行计数而受到标注噪声的影响。此外,它们在高密度图像上也表现不佳。为了解决这些问题,我们提出了一种端到端模型,称为细粒度提取网络(FGENet)。与估计密度图的方法不同,FGENet直接学习代表个体精确定位的原始坐标点。本研究设计了一个融合模块,名为细粒度特征金字塔(FGFP),用于融合由FGENet主干提取的特征图。融合后的特征随后被传递到回归头和分类头,其中回归头为给定图像提供预测点坐标,分类头确定每个预测点是个体的置信度。最后,FGENet通过匈牙利算法建立预测点与真实点之间的对应关系。为了训练FGENet,我们设计了一个鲁棒的损失函数,名为三任务组合(TTC),以减轻标注噪声的影响。在四个广泛使用的人群计数数据集上进行了大量实验。实验结果证明了FGENet的有效性。值得注意的是,我们的方法在ShanghaiTech Part A数据集上的平均绝对误差(MAE)取得了3.14个点的显著提升,展示了其相对于现有最先进方法的优越性。更令人印象深刻的是,FGENet在UCF_CC_50数据集上以MAE惊人的30.16个点提升超越了之前的基准。

关键词

引用

@article{arxiv.2401.01208,
  title  = {FGENet: Fine-Grained Extraction Network for Congested Crowd Counting},
  author = {Hao-Yuan Ma and Li Zhang and Xiang-Yi Wei},
  journal= {arXiv preprint arXiv:2401.01208},
  year   = {2024}
}

备注

Accepted by 30th International Conference on MultiMedia Modeling