中文

以自我为中心视角下的视频-语言预训练

计算机视觉与模式识别 2022-10-14 v2 人工智能

摘要

视频-语言预训练(VLP)旨在学习可迁移的表征以推进广泛的视频-文本下游任务,近来受到越来越多的关注。性能最佳的工作依赖于大规模的第三人称视频-文本数据集,如 HowTo100M。本文中,我们利用新发布的 Ego4D 数据集,沿三个方向开创以自我为中心(egocentric)的 VLP。(i)我们创建了 EgoClip,一个包含从 Ego4D 中精选的 380 万 clip-text 对的第1人称视频-文本预训练数据集,涵盖大量人类日常活动。(ii)我们提出一种新颖的预训练目标,称为 EgoNCE,它通过挖掘以自我为中心感知的正、负样本,将视频-文本对比学习适配到自我中心领域。(iii)我们引入 EgoMCQ,一个与 EgoClip 接近的开发基准,从而能对我们的 EgoClip 和 EgoNCE 中的设计决策进行有效验证和快速探索。此外,我们在三个数据集上的五个自我中心下游任务中展示了强劲性能:EPIC-KITCHENS-100 上的视频-文本检索;Charades-Ego 上的动作识别;Ego4D 挑战基准上的自然语言查询、时刻查询和物体状态变化分类。数据集与代码见 https://github.com/showlab/EgoVLP。

关键词

引用

@article{arxiv.2206.01670,
  title  = {Egocentric Video-Language Pretraining},
  author = {Kevin Qinghong Lin and Alex Jinpeng Wang and Mattia Soldan and Michael Wray and Rui Yan and Eric Zhongcong Xu and Difei Gao and Rongcheng Tu and Wenzhe Zhao and Weijie Kong and Chengfei Cai and Hongfa Wang and Dima Damen and Bernard Ghanem and Wei Liu and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2206.01670},
  year   = {2022}
}

备注

Accepted by NeurIPS 2022. Double champions at Ego4D and EPIC-Kitchens, CVPR 2022 challenges. 23 pages, 13 figures, 12 tables. Code: https://github.com/showlab/EgoVLP