中文

从文本网络监督中学习视频表征

计算机视觉与模式识别 2021-08-31 v2

摘要

互联网上的视频与文本片段配对,例如标题和描述。此类文本通常描述视频中最重要的内容,如场景中的物体和正在执行的动作。基于这一观察,我们提出使用文本作为学习视频表征的方法。为此,我们提出一种数据收集流程并用其收集了互联网上公开分享的 7000 万视频片段,随后训练一个模型将每个视频与其关联文本配对。我们在若干下游动作识别任务上评估该模型,包括 Kinetics、HMDB-51 和 UCF-101。我们发现该方法是一种有效的视频表征预训练方法。具体而言,它优于所有现有的自监督与跨模态视频表征学习方法。

关键词

引用

@article{arxiv.2007.14937,
  title  = {Learning Video Representations from Textual Web Supervision},
  author = {Jonathan C. Stroud and Zhichao Lu and Chen Sun and Jia Deng and Rahul Sukthankar and Cordelia Schmid and David A. Ross},
  journal= {arXiv preprint arXiv:2007.14937},
  year   = {2021}
}