中文

仅凭时间提示符,我们是否就足以进行有限标记动作识别?

计算机视觉与模式识别 2025-04-08 v2

摘要

近年来,视频理解取得了显著进展,主要依赖大规模标记数据集。基于对比预训练的视觉语言模型,尤其是基于对比学习的模型,在零样态任务中展现出惊人的泛化能力,有助于克服对标记数据集的依赖。针对视频数据的此类模型通常会通过修改视觉语言模型的架构来实现,这并非易事,因为此类修改大多计算密集且难以处理时序建模。我们提出了 TP-CLIP,这是一种利用时序视觉提示符进行时序适应的 CLIP 变体,无需修改核心 CLIP 架构即可实现时序适应。这保留了其泛化能力。TP-CLIP 高效地集成到了 CLIP 架构中,利用其预训练能力处理视频数据。广泛的实验表明,它在零样态和少样本学习中效果显著,超过了现有方法,同时参数更少且计算效率更高。特别是,我们仅使用了最新 SOTA 方法的 1/3 的 GFLOPs 和 1/28 的可调参数,仍能在特定任务和数据集上超过 15.8%。

关键词

引用

@article{arxiv.2504.01890,
  title  = {Is Temporal Prompting All We Need For Limited Labeled Action Recognition?},
  author = {Shreyank N Gowda and Boyan Gao and Xiao Gu and Xiaobo Jin},
  journal= {arXiv preprint arXiv:2504.01890},
  year   = {2025}
}

备注

Accepted in CVPR-W 2025