中文

VideoSSL:面向视频分类的半监督学习方法

计算机视觉与模式识别 2020-03-03 v1

摘要

我们提出了一种用于视频分类的半监督学习方法 VideoSSL,该方法使用卷积神经网络(CNN)。与其他计算机视觉任务类似,现有的有监督视频分类方法需要大量标注数据才能获得良好性能。然而,大规模数据集的标注昂贵且耗时。为尽量减少对大型标注数据集的依赖,我们提出的半监督方法从少量标注样本出发进行训练,并利用来自无标注数据的两种正则信号。第一种信号是由正在训练的 CNN 的置信度计算得到的无标注样本的伪标签。另一种是由图像分类器 CNN 预测的归一化概率,其捕捉了视频中感兴趣物体外观的信息。我们表明,在这些来自无标注样本的引导信号监督下,视频分类 CNN 能够在 UCF101、HMDB51 和 Kinetics 三个公开数据集上仅利用一小部分标注样本就取得令人印象深刻的性能。

关键词

引用

@article{arxiv.2003.00197,
  title  = {VideoSSL: Semi-Supervised Learning for Video Classification},
  author = {Longlong Jing and Toufiq Parag and Zhe Wu and Yingli Tian and Hongcheng Wang},
  journal= {arXiv preprint arXiv:2003.00197},
  year   = {2020}
}