中文

骨架比文本语音更有力:基于视频的人形重识别动作感知预训练范式

计算机视觉与模式识别 2025-11-18 v1

摘要

多模态预训练已彻底改变了视觉理解,但其对视频-based人形重识别(ReID)的影响仍未得到充分探索。现有方法常依赖视频文本对,却受限于两个根本性局限:(1)缺乏真正的多模态预训练,(2)文本难以捕捉细粒度的时序运动——这对于区分视频中身份标识至关重要。在本工作中,我们大胆地采用文本为导向范式,提出首个基于骨架驱动的预训练框架用于ReID。为实现此目标,我们提出Contrastive Skeleton-Image Pretraining for ReID (CSIP-ReID),一种新型两阶段方法,利用骨架序列作为时空信息丰富的模态与视频帧对齐。在第一个阶段,我们采用对比学习在序列层面对齐骨架与视觉特征。在第二个阶段,我们引入动态原型融合更新器(PFU)来细化多模态身份原型,融合运动与外观线索。此外,我们提出骨架引导时序建模(SGTM)模块,从骨架数据中提取时序线索并融入视觉特征。大量实验表明,CSIP-ReID在标准视频ReID基准数据集(MARS, LS-VID, iLIDS-VID)上取得新型状加权结果。更重要的是,它在骨架-only ReID任务(BIWI, IAS)上展现出强大的泛化能力,显著优于先前方法。CSIP-ReID开创了ReID领域的无标注且动作感知的预训练范式,为多模态表征学习开辟了新前沿。

关键词

引用

@article{arxiv.2511.13150,
  title  = {Skeletons Speak Louder than Text: A Motion-Aware Pretraining Paradigm for Video-Based Person Re-Identification},
  author = {Rifen Lin and Alex Jinpeng Wang and Jiawei Mo and Min Li},
  journal= {arXiv preprint arXiv:2511.13150},
  year   = {2025}
}