中文

重访分类器:迁移视觉-语言模型用于视频识别

计算机视觉与模式识别 2023-03-28 v4

摘要

将任务无关预训练深度模型的知识迁移至下游任务是计算机视觉研究中的重要课题。随着计算能力的增长,我们现在拥有了大规模模型架构与数据量的开源视觉-语言预训练模型。在本研究中,我们聚焦于视频分类任务的迁移知识。常规方法为视觉分类随机初始化线性分类器头,却未探索文本编码器在下游视觉识别任务中的用法。本文中,我们重新审视线性分类器的作用,并用预训练模型中不同的知识替换分类器。我们利用良好预训练的语言模型生成良好的语义目标以实现高效迁移学习。实证研究表明,我们的方法在模型改动可忽略的情况下,同时提升了视频分类的性能与训练速度。这一简单而有效的调优范式在零样本、少样本、通用识别等多种视频识别场景下实现了最先进的性能与高效训练。特别地,我们的范式在 Kinetics-400 上取得了 87.8% 的最先进准确率,并在五个流行视频数据集的零样本、少样本设定下以 20~50% 的绝对 top-1 准确率超越以往方法。代码与模型见 https://github.com/whwu95/Text4Vis。

关键词

引用

@article{arxiv.2207.01297,
  title  = {Revisiting Classifier: Transferring Vision-Language Models for Video Recognition},
  author = {Wenhao Wu and Zhun Sun and Wanli Ouyang},
  journal= {arXiv preprint arXiv:2207.01297},
  year   = {2023}
}

备注

Accepted by AAAI-2023. Camera Ready Version