中文

语言引导与运动感知的步态表示用于泛化识别

计算机视觉与模式识别 2026-01-26 v2

摘要

步态识别正成为计算机视觉中一项有前景的技术和创新领域,在远程人体识别中有着广泛的应用。然而,现有方法通常依赖复杂的架构直接从图像中提取特征,并应用池化操作来获得序列级表示。这种设计往往会导致对静态噪声(如衣物)的过拟合,同时无法有效捕捉动态运动区域,例如手臂和腿部。在存在类内变化的情况下,这一瓶颈尤其具有挑战性,因为同一个体在不同环境条件下的步态特征在特征空间中相距甚远。为了解决上述挑战,我们提出了一个名为LMGait的语言引导与运动感知步态识别框架。据我们所知,LMGait是首个将自然语言描述作为显式语义先验引入步态识别任务的方法。具体而言,我们利用设计的步态相关语言线索来捕捉步态序列中的关键运动特征。为了改善跨模态对齐,我们提出了运动感知模块(MAM),该模块通过自适应调整不同层次的语义信息来细化语言特征,以确保与视觉表示更好地对齐。此外,我们引入了运动时序捕捉模块(MTCM)来增强步态特征的判别能力并提高模型的运动跟踪能力。我们在多个数据集上进行了广泛的实验,结果证明了我们提出的网络的显著优势。具体来说,我们的模型在CCPG、SUSTech1K和CASIAB数据集上分别达到了88.5%、97.1%和97.5%的准确率,实现了最先进的性能。主页:https://dingwu1021.github.io/LMGait/

关键词

引用

@article{arxiv.2601.11931,
  title  = {Language-Guided and Motion-Aware Gait Representation for Generalizable Recognition},
  author = {Zhengxian Wu and Chuanrui Zhang and Shenao Jiang and Hangrui Xu and Zirui Liao and Luyuan Zhang and Huaqiu Li and Peng Jiao and Haoqian Wang},
  journal= {arXiv preprint arXiv:2601.11931},
  year   = {2026}
}