中文

通过视频与文本配对判别学习时空特征

计算机视觉与模式识别 2021-01-29 v3

摘要

当前的视频表示严重依赖从人工标注的视频数据集中学习,这类数据集获取耗时且昂贵。我们观察到视频自然伴随着丰富的文本信息,如 YouTube 标题和 Instagram 说明文字。在本文中,我们利用这种视觉-文本关联以高效的弱监督方式学习时空特征。我们提出一个通用的跨模态配对判别(CPD)框架来捕捉视频与其关联文本之间的相关性。具体而言,我们采用噪声对比估计来解决由海量配对实例类别带来的计算问题,并设计了一种实用的课程学习策略。我们在标准视频数据集(Kinetics-210k)和未筛选的网络视频数据集(Instagram-300k)上训练我们的 CPD 模型以证明其有效性。无需进一步微调,所学模型在 Kinetics 上基于线性分类协议取得了具有竞争力的动作分类结果。此外,我们的视觉模型为下游任务微调提供了有效的初始化,与现有最先进的自监督训练方法相比,在 UCF101 和 HMDB51 上的动作识别取得了显著性能提升。另外,我们的 CPD 模型通过直接利用学到的视觉-文本嵌入,在 UCF101 上实现了零样本动作识别的新最优结果。代码将发布于 https://github.com/MCG-NJU/CPD-Video。

关键词

引用

@article{arxiv.2001.05691,
  title  = {Learning Spatiotemporal Features via Video and Text Pair Discrimination},
  author = {Tianhao Li and Limin Wang},
  journal= {arXiv preprint arXiv:2001.05691},
  year   = {2021}
}

备注

Technical Report