中文

用于视频表征学习的自监督时间判别学习

计算机视觉与模式识别 2020-08-06 v1

摘要

视频中的时间线索为准确识别动作提供了重要信息。然而,若不借助标注的大规模视频动作数据集进行训练,时间判别特征很难被提取。本文提出一种新颖的基于视频的时间判别学习(VTDL)自监督框架。在无标注数据用于网络预训练的情况下,通过对同一或不同时间间隔的片段进行采样,为每个锚视频生成时间三元组,从而增强时间特征表征能力。通过时间导数度量时间信息,设计了时间一致增强(TCA)以确保增强正样本的时间导数(任意阶)除缩放常数外保持不变。最后,通过最小化每个锚与其增强正样本之间的距离,同时最大化每个锚与其增强负样本以及记忆库中保存的其他视频之间的距离来学习时间判别特征,以丰富表征多样性。在下游动作识别任务中,所提方法显著优于现有相关工作。令人惊讶的是,当使用小规模视频数据集(仅数千个视频)进行预训练时,所提自监督方法在 UCF101 和 HMDB51 上优于全监督方法。代码已公开于 https://github.com/FingerRec/Self-Supervised-Temporal-Discriminative-Representation-Learning-for-Video-Action-Recognition。

关键词

引用

@article{arxiv.2008.02129,
  title  = {Self-supervised Temporal Discriminative Learning for Video Representation Learning},
  author = {Jinpeng Wang and Yiqi Lin and Andy J. Ma and Pong C. Yuen},
  journal= {arXiv preprint arXiv:2008.02129},
  year   = {2020}
}

备注

10 pages