SVFormer: 用于动作识别的半监督视频 Transformer
计算机视觉与模式识别
2023-04-07 v2
摘要
半监督动作识别因视频标注成本高而是一项具挑战性却关键的任务。现有方法主要使用卷积神经网络,而当前革命性的视觉 transformer 模型则较少被探索。本文中,我们研究在 SSL 设定下将 transformer 模型用于动作识别。为此,我们引入 SVFormer,其采用稳定的伪标签框架(即 EMA-Teacher)来处理未标注视频样本。尽管大量数据增强已被证明对半监督图像分类有效,但它们通常对视频识别产生有限结果。因此我们引入一种新颖的增强策略 Tube TokenMix,专为视频数据设计,其中视频片段通过沿时间轴一致的掩码令牌的掩码进行混合。此外,我们提出时间扭曲增强以覆盖视频中复杂的时间变化,其将选定帧拉伸至片段内的不同时间时长。在 Kinetics-400、UCF-101 与 HMDB-51 三个数据集上的大量实验验证了 SVFormer 的优势。特别地,在 Kinetics-400 的 1% 标注率下,SVFormer 以更少训练轮数比最先进方法高出 31.5%。我们的方法有望作为强基准,并激励未来关于使用 Transformer 网络的半监督动作识别的探索。
引用
@article{arxiv.2211.13222,
title = {SVFormer: Semi-supervised Video Transformer for Action Recognition},
author = {Zhen Xing and Qi Dai and Han Hu and Jingjing Chen and Zuxuan Wu and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2211.13222},
year = {2023}
}