UniVL:一种面向多模态理解与生成的统一视频与语言预训练模型
计算机视觉与模式识别
2020-09-16 v3 计算与语言
机器学习
音频与语音处理
图像与视频处理
摘要
随着预训练技术在自然语言处理和图像-语言任务中取得近期成功,一些视频-语言预训练工作逐渐发展起来,以改善视频-文本相关的下游任务。然而,现有多数多模态模型是为理解任务预训练的,导致在生成任务上存在预训练-微调的不一致。本文提出 UniVL:一种面向多模态理解与生成的统一视频与语言预训练模型。它包含四个组件,包括两个单模态编码器、一个交叉编码器和一个基于 Transformer 主干的解码器。设计了五个目标,包括视频-文本联合、条件掩码语言模型(CMLM)、条件掩码帧模型(CMFM)、视频-文本对齐和语言重建,用于训练各个组件。我们进一步提出了两种预训练策略,即分阶段预训练(StagedP)和增强视频表示(EnhancedV),以使 UniVL 的训练过程更加有效。预训练在一个大规模教学视频数据集 HowTo100M 上进行。实验结果表明,UniVL 能够学习到强大的视频-文本表示,并在五个下游任务上取得了最先进(state-of-the-art)的结果。
引用
@article{arxiv.2002.06353,
title = {UniVL: A Unified Video and Language Pre-Training Model for Multimodal Understanding and Generation},
author = {Huaishao Luo and Lei Ji and Botian Shi and Haoyang Huang and Nan Duan and Tianrui Li and Jason Li and Taroon Bharti and Ming Zhou},
journal= {arXiv preprint arXiv:2002.06353},
year = {2020}
}