中文

通过基于相似性的知识蒸馏进行自监督视频表征的辅助学习

计算机视觉与模式识别 2022-04-26 v3

摘要

尽管自监督预训练方法在视频表征学习方面取得了显著成功,但当用于预训练的无标签数据集较小或源任务(预训练)中的无标签数据与目标任务(微调)中的有标签数据之间的领域差异显著时,它们的泛化能力较差。为了缓解这些问题,我们提出了一种新方法,通过基于知识相似性蒸馏的辅助预训练阶段(auxSKD)来补充自监督预训练,从而在使用显著更少的视频数据(例如,Kinetics-100而非Kinetics-400)时实现更好的泛化。我们的方法部署了一个教师网络,通过捕获无标签视频数据片段之间的相似性信息,迭代地将其知识蒸馏给学生模型。同时,学生模型通过利用这些先验知识来解决一个前置任务。我们还引入了一个新的前置任务,即视频片段播放速度预测(VSPP),该任务要求我们的模型预测输入视频中随机选择片段的播放速度,以提供更可靠的自监督表征。我们的实验结果显示,在公平比较中,当在K100上进行预训练时,我们在UCF101和HMDB51数据集上均取得了优于现有最佳方法的结果。此外,我们表明,当将我们的辅助预训练auxSKD作为额外的预训练阶段添加到最近最先进的自监督方法(即VCOP、VideoPace和RSPNet)中时,能够提升它们在UCF101和HMDB51上的结果。我们的代码可在https://github.com/Plrbear/auxSKD获取。

关键词

引用

@article{arxiv.2112.04011,
  title  = {Auxiliary Learning for Self-Supervised Video Representation via Similarity-based Knowledge Distillation},
  author = {Amirhossein Dadashzadeh and Alan Whone and Majid Mirmehdi},
  journal= {arXiv preprint arXiv:2112.04011},
  year   = {2022}
}