中文

扩展语言-图像预训练模型用于通用视频识别

计算机视觉与模式识别 2022-08-05 v1

摘要

对比语言-图像预训练已从网络规模数据中学习视觉-文本联合表征方面取得巨大成功,展现出对各种图像任务卓越的“零样本”泛化能力。然而,如何有效地将此类新兴的语言-图像预训练方法扩展到视频领域仍是一个开放问题。本工作中,我们提出一种简单而有效的方法,直接将预训练的语言-图像模型适配到视频识别,而非从零预训练新模型。具体而言,为捕获沿时间维度的帧间长程依赖,我们提出一种跨帧注意力机制,显式地跨帧交换信息。该模块轻量且可无缝插入预训练的语言-图像模型。此外,我们提出一种视频专用提示方案,利用视频内容信息生成有判别力的文本提示。大量实验表明我们的方法有效且可泛化至不同视频识别场景。尤其在全监督设定下,我们的方法在 Kinectics-400 上达到 87.1% 的 top-1 准确率,同时使用比 Swin-L 和 ViViT-H 少 12 倍的 FLOPs。在零样本实验中,我们的方法在两种流行协议下 top-1 准确率超越当前最先进方法 +7.6% 和 +14.9%。在少样本场景中,当标注数据极度有限时,我们的方法超越先前最佳方法 +32.1% 和 +23.1%。代码与模型见 https://aka.ms/X-CLIP

关键词

引用

@article{arxiv.2208.02816,
  title  = {Expanding Language-Image Pretrained Models for General Video Recognition},
  author = {Bolin Ni and Houwen Peng and Minghao Chen and Songyang Zhang and Gaofeng Meng and Jianlong Fu and Shiming Xiang and Haibin Ling},
  journal= {arXiv preprint arXiv:2208.02816},
  year   = {2022}
}

备注

Accepted by ECCV2022, Oral