通过多方面注意力提升人群计数
计算机视觉与模式识别
2022-03-08 v1
摘要
本文关注具有挑战性的人群计数任务。由于人群图像中常存在大规模变化,CNN 的固定尺寸卷积核与近期视觉 transformer 的固定尺寸注意力均难以很好地处理此类变化。为解决该问题,我们提出一种多方面注意力网络(MAN)以改进 transformer 模型在局部空间关系编码上的表现。MAN 将来自普通 transformer 的全局注意力、可学习的局部注意力以及实例注意力整合进计数模型。首先,提出局部可学习区域注意力(LRA),为每个特征位置动态分配专属注意力。其次,我们设计局部注意力正则化,通过最小化不同特征位置注意力之间的偏差来监督 LRA 的训练。最后,我们提供实例注意力机制,在训练过程中动态聚焦于最重要的实例。在 ShanghaiTech、UCF-QNRF、JHU++ 和 NWPU 四个具挑战性的人群计数数据集上的大量实验验证了所提方法。代码:https://github.com/LoraLinH/Boosting-Crowd-Counting-via-Multifaceted-Attention。
引用
@article{arxiv.2203.02636,
title = {Boosting Crowd Counting via Multifaceted Attention},
author = {Hui Lin and Zhiheng Ma and Rongrong Ji and Yaowei Wang and Xiaopeng Hong},
journal= {arXiv preprint arXiv:2203.02636},
year = {2022}
}
备注
Accepted by IEEE CVPR 2022. Codes available at: https://github.com/LoraLinH/Boosting-Crowd-Counting-via-Multifaceted-Attention