基于编码器-解码器且带多尺度感知模块的卷积神经网络用于人群计数
计算机视觉与模式识别
2021-05-12 v5 人工智能
摘要
在本文中,我们提出了两种基于双路径多尺度融合网络(SFANet)和 SegNet 的改进神经网络,用于准确且高效的人群计数。受 SFANet 启发,第一个模型名为 M-SFANet,附加了空洞空间金字塔池化(ASPP)和上下文感知模块(CAN)。M-SFANet 的编码器通过包含具有不同采样率的并行空洞卷积层的 ASPP 得到增强,因此能够提取目标对象的多尺度特征并融入更大的上下文。为了进一步处理输入图像中整体的尺度变化,我们利用了 CAN 模块,其自适应地编码上下文信息的尺度。该组合产生了一种在密集和稀疏人群场景中均有效的计数模型。基于 SFANet 解码器结构,M-SFANet 的解码器具有双路径,用于生成密度图和注意力图。第二个模型称为 M-SegNet,通过将 SFANet 中的双线性上采样替换为 SegNet 中使用的最大反池化而得到。这一改变提供了更快的模型,同时具备有竞争力的计数性能。专为高速监控应用设计,M-SegNet 没有额外的多尺度感知模块以避免增加复杂度。两种模型均为基于编码器-解码器的架构且可端到端训练。我们在五个人群计数数据集和一个车辆计数数据集上进行了大量实验,表明这些改进产生的算法能够改进最先进的人群计数方法。代码见 https://github.com/Pongpisit-Thanasutives/Variations-of-SFANet-for-Crowd-Counting。
引用
@article{arxiv.2003.05586,
title = {Encoder-Decoder Based Convolutional Neural Networks with Multi-Scale-Aware Modules for Crowd Counting},
author = {Pongpisit Thanasutives and Ken-ichi Fukui and Masayuki Numao and Boonserm Kijsirikul},
journal= {arXiv preprint arXiv:2003.05586},
year = {2021}
}
备注
Accepted at ICPR 2020