中文

ReIDMamba:基于视觉状态空间模型学习判别特征的人体再识别

计算机视觉与模式识别 2025-11-12 v1

摘要

从人体再识别(ReID)中提取鲁棒的判别特征是一项关键挑战。虽然基于Transformer的方法已成功解决了卷积神经网络(CNN)的一些局限性问题,如其本地化处理特性以及因卷积和下采样操作导致的信息损失,但仍面临由于输入序列长度导致的内存和计算需求呈二次增长的可扩展性问题。为此,我们提出了基于纯Mamba架构的人体再识别框架,命名为ReIDMamba。具体而言,我们设计了基于Mamba的强基线模型,通过引入多个类别标记,有效地利用细粒度、判别性的全局特征。为进一步增强Mamba中鲁棒特征的学习,我们仔细设计了两种新技术。首先,采用多分支架构和类别标记融合设计的多粒度特征提取器(MGFE)模块,有效构建多粒度特征,提升判别能力和细粒度覆盖范围。其次,引入基于排序的三角形正则化(RATR),以减少来自多个分支特征的冗余性,通过融合类内和类间多样性约束,增强多粒度特征的多样性,从而确保人体特征的鲁棒性。迄今为止,这是首个将纯粹的Mamba方法集成到ReID研究中的工作。我们提出的ReIDMamba模型参数仅为TransReID的三分之一,同时具有更低的GPU内存占用和更快的推理吞吐量。实验结果表明,ReIDMamba在五个人体再识别基准数据集上均实现了卓越且有前景的性能,达到了状态最佳的水平。代码已公开于https://github.com/GuHY777/ReIDMamba。

关键词

引用

@article{arxiv.2511.07948,
  title  = {ReIDMamba: Learning Discriminative Features with Visual State Space Model for Person Re-Identification},
  author = {Hongyang Gu and Qisong Yang and Lei Pu and Siming Han and Yao Ding},
  journal= {arXiv preprint arXiv:2511.07948},
  year   = {2025}
}

备注

11 pages, 8 figures. Accepted to IEEE Transactions on Multimedia (TMM). Accepted Manuscript version uploaded