TDS-CLIP:用于高效视频动作识别的时序差分侧网络
计算机视觉与模式识别
2025-06-13 v2
摘要
近年来,大规模预训练视觉语言模型(如CLIP)因其强大的表征能力而受到广泛关注。这激发了研究人员将大型预训练模型中的知识迁移到其他任务特定模型(如视频动作识别模型)的研究兴趣,特别是通过利用侧网络来增强参数高效微调(PEFT)的效率。然而,当前VAR中的迁移方法倾向于以最小代价直接将冻结知识从大型预训练模型迁移到动作识别网络,而未充分利用动作识别模型本身的时序建模能力。因此,在本文中,我们提出了一种新颖的、内存高效的时序差分侧网络(TDS-CLIP),以平衡知识迁移与时序建模,避免在冻结参数模型中进行反向传播。具体而言,我们引入了一种时序差分适配器(TD-Adapter),能够有效捕获运动特征中的局部时序差异,从而增强模型的全局时序建模能力。此外,我们设计了一种侧运动增强适配器(SME-Adapter),用于引导所提出的侧网络高效学习视频中的丰富运动信息,从而提高侧网络捕获和学习运动信息的能力。我们在三个基准数据集上进行了广泛实验,包括Something-Something V1&V2和Kinetics-400。实验结果表明,我们的方法在视频动作识别任务中取得了具有竞争力的性能。
引用
@article{arxiv.2408.10688,
title = {TDS-CLIP: Temporal Difference Side Network for Efficient VideoAction Recognition},
author = {Bin Wang and Wentong Li and Wenqian Wang and Mingliang Gao and Runmin Cong and Wei Zhang},
journal= {arXiv preprint arXiv:2408.10688},
year = {2025}
}