中文

OmniCLIP:通过空间-时间全尺度特征学习适配CLIP用于视频识别

计算机视觉与模式识别 2024-08-13 v1

摘要

近期的视觉-语言模型(VLMs),例如CLIP,在视频识别方面取得了巨大进展。尽管强大的视觉骨干网络在提取空间特征方面带来了改进,但CLIP在捕捉和整合空间-时间特征方面仍然不足,而空间-时间特征对于视频识别至关重要。在本文中,我们提出了OmniCLIP,一个通过专注于学习涵盖空间、时间以及动态空间-时间尺度的综合特征来适配CLIP进行视频识别的框架,我们称之为全尺度特征。这是通过设计包含并行时间适配器(PTA)的空间-时间模块来实现的,从而实现高效的时间建模。此外,我们引入了一个自提示生成器(SPG)模块来捕捉动态物体的空间特征。PTA和SPG之间的协同作用使OmniCLIP能够辨别不同帧之间的空间信息,并随时间评估物体尺度。我们在监督视频识别、少样本视频识别和零样本识别任务上进行了广泛实验。结果证明了我们的方法的有效性,特别是OmniCLIP在16-shot设置下在HMDB51上取得了74.30%的top-1准确率,超越了最近的MotionPrompt方法,即使使用完整训练数据。代码可在\url{https://github.com/XiaoBuL/OmniCLIP}获取。

关键词

引用

@article{arxiv.2408.06158,
  title  = {OmniCLIP: Adapting CLIP for Video Recognition with Spatial-Temporal Omni-Scale Feature Learning},
  author = {Mushui Liu and Bozheng Li and Yunlong Yu},
  journal= {arXiv preprint arXiv:2408.06158},
  year   = {2024}
}

备注

ECAI-2024