中文

SilLang:通过剪影语言编码提升步态识别

计算机视觉与模式识别 2026-03-26 v1

摘要

步态剪影可编码为二进制步态码,广泛用于表示行人运动模式。近期方法通常利用视觉主干网络对步态剪影进行编码,取得了成功的性能。然而,这些方法主要关注连续视觉特征,忽略了二进制剪影的离散本质,这种本质特征本就与自然语言共享离散编码空间。大型语言模型(LLM)在从离散序列中提取判别性特征和建模长程依赖方面表现卓越,凸显了其捕捉通过识别细微变化来捕捉时序运动模式的潜力。受此启发,我们探索将二进制步态剪影与自然语言置于统一的二进制编码空间中。然而,文本标记和二进制步态剪影的编码空间仍不一致,主要源于标记频率和密度差异。为此,我们提出了轮廓-速度标记器(Contour-Velocity Tokenizer),该方法在编码二进制步态剪影的同时,重塑其分布以更好地对齐文本标记空间。随后,我们建立了一个双分支框架,称为 Silhouette Language Model,通过整合来自 LLM 的离散语言嵌入来增强视觉剪影。该方法在主流步态主干网络上实现,Consistently 在 SUSTech1K、GREW 和 Gait3D 上提升了最新方法的性能。

关键词

引用

@article{arxiv.2603.23976,
  title  = {SilLang: Improving Gait Recognition with Silhouette Language Encoding},
  author = {Ruiyi Zhan and Guozhen Peng and Canyu Chen and Jian Lei and Annan Li},
  journal= {arXiv preprint arXiv:2603.23976},
  year   = {2026}
}