DistInit:无需任何带标签视频学习视频表示
计算机视觉与模式识别
2019-08-21 v2
摘要
视频识别模型在过去几年中取得了显著进展,从基于手工特征训练的浅层分类器演变为深度时空网络。然而,训练此类模型所需的带标签视频数据未能跟上这些网络日益增加的深度与复杂度。在这项工作中,我们提出了一种学习视频表示的替代方法,该方法不需要语义标注的视频,而是利用多年来在收集和标注大型干净静态图像数据集方面的努力。为此,我们使用在图像数据集上预训练的先进模型作为“教师”,在蒸馏框架中训练视频模型。我们证明,尽管仅使用来自静态图像网络的监督进行训练,我们的方法学到了真正的时空特征。此外,它跨不同输入模态学习到良好表示,使用完全未筛选的原始视频数据源以及不同的二维教师模型。我们的方法获得了强劲的迁移性能,以图像模型引导视频架构的标准技术相比高出16%。我们认为,我们的方法为从无标签视频数据学习时空表示开辟了新途径。
引用
@article{arxiv.1901.09244,
title = {DistInit: Learning Video Representations Without a Single Labeled Video},
author = {Rohit Girdhar and Du Tran and Lorenzo Torresani and Deva Ramanan},
journal= {arXiv preprint arXiv:1901.09244},
year = {2019}
}
备注
ICCV 2019