中文

以自我为中心的视频-语言预训练 @ Ego4D 挑战赛 2022

计算机视觉与模式识别 2022-08-04 v2

摘要

在本报告中,我们提出一种基于视频-语言预训练(VLP)的解决方案 \cite{kevin2022egovlp},用于四项 Ego4D 挑战任务,包括自然语言查询(NLQ)、时刻查询(MQ)、物体状态变化分类(OSCC)和 PNR 定位(PNR)。特别地,我们利用近期发布的 Ego4D 数据集 \cite{grauman2021ego4d},从预训练数据集、预训练目标和开发集三方面开创以自我为中心的 VLP。基于上述三种设计,我们开发了一个预训练视频-语言模型,能够将其以自我为中心的视频-文本表示或仅视频表示迁移至若干视频下游任务。我们的以自我为中心的 VLP 在 NLQ 上取得 10.46R@1&IoU @0.3,在 MQ 上取得 10.33 mAP,在 OSCC 上取得 74% Acc,在 PNR 上取得 0.67 sec error。代码见 https://github.com/showlab/EgoVLP。

关键词

引用

@article{arxiv.2207.01622,
  title  = {Egocentric Video-Language Pretraining @ Ego4D Challenge 2022},
  author = {Kevin Qinghong Lin and Alex Jinpeng Wang and Mattia Soldan and Michael Wray and Rui Yan and Eric Zhongcong Xu and Difei Gao and Rongcheng Tu and Wenzhe Zhao and Weijie Kong and Chengfei Cai and Hongfa Wang and Dima Damen and Bernard Ghanem and Wei Liu and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2207.01622},
  year   = {2022}
}

备注

Preprint. 4 pages, 2 figures, 5 tables. Code: https://github.com/showlab/EgoVLP. The Ego4D challenge technical report of EgoVLP arXiv:2206.01670. See EPIC challenge technical report arXiv:2207.01334 for overlap