中文

用于视频表征学习的自监督协同训练

计算机视觉与模式识别 2021-01-13 v2

摘要

本文的目标是仅依靠视觉的自监督视频表征学习。我们做出以下贡献:(i)我们研究了在基于样本的Info Noise Contrastive Estimation(InfoNCE)训练中引入语义类正样本的益处,表明这种有监督对比学习形式带来了性能的明显提升;(ii)我们提出了一种新颖的自监督协同训练方案来改进流行的infoNCE损失,通过利用同一数据源不同视角(RGB流与光流)的互补信息,使用一个视角为另一个视角获取正类样本;(iii)我们在两个不同下游任务上充分评估所学表征的质量:动作识别与视频检索。在两种情况下,所提方法都展现出与其他自监督方法相当或最先进的性能,同时训练效率显著更高,即需要远少的训练数据即可达到相似性能。

关键词

引用

@article{arxiv.2010.09709,
  title  = {Self-supervised Co-training for Video Representation Learning},
  author = {Tengda Han and Weidi Xie and Andrew Zisserman},
  journal= {arXiv preprint arXiv:2010.09709},
  year   = {2021}
}

备注

NeurIPS2020