基于注意力引导的多尺度上下文聚合网络用于人群计数
计算机视觉与模式识别
2021-04-07 v1 人工智能
摘要
人群计数旨在预测图像中人数并生成密度图。存在诸多挑战,包括头部尺度变化、跨图像人群分布的多样性以及杂乱背景。本文中,我们提出一种基于单列编码器-解码器架构的多尺度上下文聚合网络(MSCANet)用于人群计数,其由基于密集上下文感知模块(DCAM)的编码器与分层注意力引导解码器组成。为处理尺度变化问题,我们构建 DCAM 通过密集连接具有不同感受野的空洞卷积来聚合多尺度上下文信息。所提 DCAM 因其长程感受野与密集尺度采样能够捕获人群区域的丰富上下文信息。此外,为抑制背景噪声并生成高质量密度图,我们在解码器中采用分层注意力引导机制。这通过引入基于语义注意力模块(SAM)的多重监督,有助于从编码器浅层特征图整合更有用的空间信息。大量实验表明,所提方法在三个具挑战性的人群计数基准数据集上取得了优于其他类似最先进方法的性能。代码见 https://github.com/KingMV/MSCANet
引用
@article{arxiv.2104.02245,
title = {Multi-Scale Context Aggregation Network with Attention-Guided for Crowd Counting},
author = {Xin Wang and Yang Zhao and Tangwen Yang and Qiuqi Ruan},
journal= {arXiv preprint arXiv:2104.02245},
year = {2021}
}