中文

SVFormer: 用于动作识别的半监督视频 Transformer

计算机视觉与模式识别 2023-04-07 v2

摘要

半监督动作识别因视频标注成本高而是一项具挑战性却关键的任务。现有方法主要使用卷积神经网络,而当前革命性的视觉 transformer 模型则较少被探索。本文中,我们研究在 SSL 设定下将 transformer 模型用于动作识别。为此,我们引入 SVFormer,其采用稳定的伪标签框架(即 EMA-Teacher)来处理未标注视频样本。尽管大量数据增强已被证明对半监督图像分类有效,但它们通常对视频识别产生有限结果。因此我们引入一种新颖的增强策略 Tube TokenMix,专为视频数据设计,其中视频片段通过沿时间轴一致的掩码令牌的掩码进行混合。此外,我们提出时间扭曲增强以覆盖视频中复杂的时间变化,其将选定帧拉伸至片段内的不同时间时长。在 Kinetics-400、UCF-101 与 HMDB-51 三个数据集上的大量实验验证了 SVFormer 的优势。特别地,在 Kinetics-400 的 1% 标注率下,SVFormer 以更少训练轮数比最先进方法高出 31.5%。我们的方法有望作为强基准,并激励未来关于使用 Transformer 网络的半监督动作识别的探索。

关键词

引用

@article{arxiv.2211.13222,
  title  = {SVFormer: Semi-supervised Video Transformer for Action Recognition},
  author = {Zhen Xing and Qi Dai and Han Hu and Jingjing Chen and Zuxuan Wu and Yu-Gang Jiang},
  journal= {arXiv preprint arXiv:2211.13222},
  year   = {2023}
}