中文

用于跨模态人群计数的空间-通道注意力模块

计算机视觉与模式识别 2022-11-15 v4

摘要

人群计数研究已在现实应用中取得显著进展,但在跨模态场景下仍是一项艰巨挑战。大多数现有方法仅依赖RGB图像的光学特征,忽略了热图像和深度图像等其他模态的可行性。不同模态之间固有的显著差异以及模型架构设计选择的多样性使得跨模态人群计数更具挑战性。本文提出跨模态空间-通道注意力(CSCA)模块,其可轻松集成到任何特定模态的架构中。CSCA模块首先通过空间-wise跨模态注意力以较低开销在空间上捕获多模态间的全局功能关联。具有空间注意力的跨模态特征随后通过自适应通道-wise特征聚合进行精炼。在我们的实验中,所提模块在各种骨干网络上始终显示出显著的性能提升,从而在RGB-T和RGB-D人群计数中取得了最先进的结果。

关键词

引用

@article{arxiv.2210.10392,
  title  = {Spatio-channel Attention Blocks for Cross-modal Crowd Counting},
  author = {Youjia Zhang and Soyun Choi and Sungeun Hong},
  journal= {arXiv preprint arXiv:2210.10392},
  year   = {2022}
}

备注

Accepted to ACCV 2022 (Oral). Code is available at https://github.com/vcllab/csca