关于 Transformer 在少标签视频识别中惊人有效性的研究
计算机视觉与模式识别
2022-10-27 v3 机器学习
摘要
近来,视觉 Transformer 已被证明在多种视觉任务中可与基于卷积的方法(CNN)相竞争。与 CNN 相比,Transformer 较弱的归纳偏置赋予了其更强的表征能力。然而,在图像分类场景中,这种灵活性是以样本效率为代价的,Transformer 需要 ImageNet 规模的训练数据。这一观念延续到了视频领域,其中 Transformer 尚未在少标签或半监督设置的视频分类中被探索。我们的工作从经验上探索了视频分类的低数据机制,并惊讶地发现,与 CNN 相比,Transformer 在少标签视频设置下表现极为出色。我们具体在两个对比鲜明的视频数据集(Kinetics-400 和 Something-Something-V2)上评估了视频视觉 Transformer,并通过详尽的分析与消融实验,利用视频 Transformer 架构的主要特征来解释这一观察。我们甚至表明,仅使用有标签数据,Transformer 也显著优于利用大规模无标签数据的复杂半监督 CNN 方法。我们的实验为我们提出建议提供依据:未来的半监督学习视频工作应考虑使用视频 Transformer。
引用
@article{arxiv.2209.07474,
title = {On the Surprising Effectiveness of Transformers in Low-Labeled Video Recognition},
author = {Farrukh Rahman and Ömer Mubarek and Zsolt Kira},
journal= {arXiv preprint arXiv:2209.07474},
year = {2022}
}
备注
Accepted to NeurIPS 2022 Workshop on Vision Transformers: Theory and applications (VTTA)