中文

基于掩码视觉建模的端到端视频-语言 Transformer 实证研究

计算机视觉与模式识别 2023-06-02 v5

摘要

掩码视觉建模(MVM)近期被证明对视觉预训练有效。尽管在视频-语言(VidL)预训练中对视频输入类似重建目标(如掩码帧建模)已有探索,先前研究未能找到一种能大幅惠及下游性能的真正有效的 MVM 策略。本工作中,我们系统考察了 MVM 在 VidL 学习中的潜力。具体地,我们的研究基于一个完全端到端的视频-语言 Transformer(VIOLET),其中来自 MVM 训练的监督可反向传播至视频像素空间。我们共探索了八种不同的 MVM 重建目标,从低层像素值和有向梯度到高层深度图、光流、离散视觉词元以及潜在视觉特征。我们进行了全面实验,并揭示了导致有效 MVM 训练的因素,从而得出增强模型 VIOLETv2。经验上,我们表明经 MVM 目标预训练的 VIOLETv2 在 13 个 VidL 基准上取得显著提升,涵盖视频问答、视频字幕生成以及文本到视频检索。

关键词

引用

@article{arxiv.2209.01540,
  title  = {An Empirical Study of End-to-End Video-Language Transformers with Masked Visual Modeling},
  author = {Tsu-Jui Fu and Linjie Li and Zhe Gan and Kevin Lin and William Yang Wang and Lijuan Wang and Zicheng Liu},
  journal= {arXiv preprint arXiv:2209.01540},
  year   = {2023}
}

备注

CVPR'23; the first two authors contributed equally; code is available at https://github.com/tsujuifu/pytorch_empirical-mvm