ActionCLIP:视频动作识别的新范式
计算机视觉与模式识别
2021-09-20 v1
摘要
视频动作识别的经典方法规定神经模型执行一个经典且标准的1-of-N多数投票任务。它们被训练来预测一组固定的预定义类别,限制了其在具有未知概念的新数据集上的可迁移能力。在本文中,我们通过对标签文本的语义信息赋予重要性而非简单地将其映射为数字,为动作识别提供了新视角。具体而言,我们将该任务建模为多模态学习框架内的视频-文本匹配问题,其以更多语义语言监督强化视频表征,并使我们的模型无需任何额外标注数据或参数要求即可进行零样本动作识别。此外,为处理标签文本的不足并利用海量网络数据,我们提出一种基于该多模态学习框架的动作识别新范式,称之为“预训练、提示与微调”。该范式首先从大量网络图像-文本或视频-文本数据的预训练中学习强大表征;然后通过提示工程使动作识别任务更接近于预训练问题;最后在目标数据集上端到端微调以获得强劲性能。我们给出了新范式的一个实例ActionCLIP,其不仅具备优越且灵活的零样本/少样本迁移能力,还在通用动作识别任务上达到顶尖性能,以ViT-B/16为骨干在Kinetics-400上取得83.8%的top-1准确率。代码见 https://github.com/sallymmx/ActionCLIP.git
引用
@article{arxiv.2109.08472,
title = {ActionCLIP: A New Paradigm for Video Action Recognition},
author = {Mengmeng Wang and Jiazheng Xing and Yong Liu},
journal= {arXiv preprint arXiv:2109.08472},
year = {2021}
}