中文

利用视频深度信息最大化进行表示学习

计算机视觉与模式识别 2020-07-29 v2 机器学习

摘要

自监督学习使无监督预训练在困难的计算机视觉任务中再次具有意义。最有效的自监督方法涉及基于从数据多样视图提取特征的预测任务。DeepInfoMax(DIM)是一种自监督方法,它利用深度网络的内部结构构造此类视图,在依赖于图像中小块局部特征与依赖于整幅图像的全局特征之间形成预测任务。本文中,我们通过利用时空网络中的类似结构将DIM扩展到视频领域,产生一种称为视频深度信息最大化(VDIM)的方法。我们发现,从自然速率序列和时间下采样序列中同时抽取视图,在Kinetics预训练的动作识别任务上取得的结果匹配或优于先前使用更昂贵大时间尺度transformer模型的最优方法。我们还考察了数据增强和微调方法的影响,在仅使用UCF-101数据集训练时以较大幅度实现了SOTA。

关键词

引用

@article{arxiv.2007.13278,
  title  = {Representation Learning with Video Deep InfoMax},
  author = {R Devon Hjelm and Philip Bachman},
  journal= {arXiv preprint arXiv:2007.13278},
  year   = {2020}
}