中文

关于基于骨架的自监督步态识别模型与数据扩展规律

计算机视觉与模式识别 2025-04-11 v1

摘要

从视频流中进行步态识别是计算机视觉生物识别中的一个具有挑战性的问题,由于步态之间的细微差异以及众多干扰因素。最近的自监督预训练技术进展推动了鲁棒的步态识别模型的开发,这些模型对步态相关的协变量具有不变性。尽管神经网络扩展规律在其他领域通过建立性能与数据量、模型规模和计算资源之间的关系来推动模型开发,但其在步态识别中的适用性尚未探讨。本文开展了首个关于基于骨架的自监督步态识别扩展规律的实证研究,以量化数据量、模型规模和计算资源对下游步态识别性能影响。我们在野外收集的270万步态序列数据集上,对多个GaitPT模型变体进行预训练——该模型基于Transformer架构。我们在四个基准数据集上评估零样本性能,以推导数据、模型规模和计算资源的扩展规律。我们的发现表明,规模增加会导致性能呈可预测的幂律式提升,并确认数据和计算资源的扩展显著影响下游准确率。我们进一步通过在受控计算预算下将GaitPT与GaitFormer进行比较来隔离架构贡献。这些结果为实际的步态识别系统提供了资源分配和性能估计的实用见解。

关键词

引用

@article{arxiv.2504.07598,
  title  = {On Model and Data Scaling for Skeleton-based Self-Supervised Gait Recognition},
  author = {Adrian Cosma and Andy Cǎtrunǎ and Emilian Rǎdoi},
  journal= {arXiv preprint arXiv:2504.07598},
  year   = {2025}
}

备注

10 pages, 10 Figures, 3 Tables