中文

VMambaCC:用于群体计数的视觉状态空间模型

计算机视觉与模式识别 2024-05-08 v1

摘要

作为一种深度学习模型,视觉Mamba(VMamba)具有低的计算复杂度和全局感受野,已成功应用于图像分类和检测。为扩展其应用,我们将VMamba应用于群体计数并提出一种新的VMambaCC(VMamba群体计数)模型。自然地,VMambaCC继承了VMamba的优势,即图像的全局建模和低计算成本。此外,我们设计了一种多头高级特征(MHF)注意力机制用于VMambaCC。MHF是一种新的注意力机制,利用高级别语义特征来增强低级别语义特征,从而以更精确的方式增强空间特征表示。建立在MHF之上,我们进一步提出了一种高级语义监督特征金字塔网络(HS2PFN),该网络逐步整合和增强高级别语义信息与低级别语义信息。广泛的实验结果表明,我们的方法在五个公开数据集上有效。例如,我们的方法在ShangHaiTech_PartA数据集上实现了平均绝对误差为51.87,平均平方误差为81.3。我们的代码即将公开。

关键词

引用

@article{arxiv.2405.03978,
  title  = {VMambaCC: A Visual State Space Model for Crowd Counting},
  author = {Hao-Yuan Ma and Li Zhang and Shuai Shi},
  journal= {arXiv preprint arXiv:2405.03978},
  year   = {2024}
}