中文

MOD:一种用于大规模视频时间概念定位的带在线知识蒸馏深度混合模型

计算机视觉与模式识别 2019-10-29 v1

摘要

在本文中,我们提出并讨论了一种用于大规模视频时间概念定位的带在线知识蒸馏的深度混合模型(MOD),该模型在第三届YouTube-8M视频理解挑战赛中排名第三。具体而言,我们发现通过在线蒸馏实现知识共享,在较小数据集上微调混合模型可以取得更好的评估性能。基于这一观察,在我们的最终方案中,我们以2层在线蒸馏结构并行训练并微调了12个NeXtVLAD模型。实验结果表明,所提出的蒸馏结构能有效避免过拟合,并展现出优越的泛化性能。代码公开于:https://github.com/linrongc/solution_youtube8m_v3

关键词

引用

@article{arxiv.1910.12295,
  title  = {MOD: A Deep Mixture Model with Online Knowledge Distillation for Large Scale Video Temporal Concept Localization},
  author = {Rongcheng Lin and Jing Xiao and Jianping Fan},
  journal= {arXiv preprint arXiv:1910.12295},
  year   = {2019}
}

备注

ICCV 2019 YouTube8M workshop