中文

All in One:探索统一的视频-语言预训练

计算机视觉与模式识别 2022-03-15 v1

摘要

主流的视频-语言预训练模型 \cite{actbert,clipbert,violet} 由三部分组成:视频编码器、文本编码器和视频-文本融合 Transformer。它们通过采用更重的单模态编码器或多模态融合 Transformer 来追求更好性能,导致参数增加且下游任务效率降低。在这项工作中,我们首次引入了一个端到端的视频-语言模型,即 \textit{all-in-one Transformer},它使用统一的骨干架构将原始视频和文本信号嵌入到联合表示中。我们认为视频数据独特的时间信息正是阻碍模态无关 Transformer 设计的关键障碍。为克服该挑战,我们引入了一种新颖且有效的 token rolling(令牌滚动)操作,以非参数方式从视频片段中编码时间表示。这一精心设计使得利用统一骨干模型进行视频-文本多模态输入与单模态输入的表示学习成为可能。我们预训练的 all-in-one Transformer 在经过微调后被迁移到各种下游视频-文本任务,包括文本-视频检索、视频问答、多项选择和视觉常识推理。在九个数据集上以最小模型 FLOPs 取得的最先进性能证明了我们的方法相对于有竞争力的同类模型的优越性。代码与预训练模型已发布于 https://github.com/showlab/all-in-one。

关键词

引用

@article{arxiv.2203.07303,
  title  = {All in One: Exploring Unified Video-Language Pre-training},
  author = {Alex Jinpeng Wang and Yixiao Ge and Rui Yan and Yuying Ge and Xudong Lin and Guanyu Cai and Jianping Wu and Ying Shan and Xiaohu Qie and Mike Zheng Shou},
  journal= {arXiv preprint arXiv:2203.07303},
  year   = {2022}
}

备注

18 pages. 11 figures. Code: https://github.com/showlab/all-in-one