基于对比式多模态预训练的中文视频与语言理解
计算机视觉与模式识别
2021-04-20 v1 多媒体
摘要
预训练神经模型近期在多模态内容理解中取得了令人印象深刻的性能。然而,由于以下原因,为视频与语言理解(尤其是中文视频-语言数据)预训练神经模型仍极具挑战。首先,现有视频-语言预训练算法主要关注词与视频帧的共现,而忽略了视频-语言内容中其他有价值的语义与结构信息,例如时序顺序与时空关系。其次,视频-句子对齐与其他代理任务之间存在冲突。第三,缺乏大规模高质量的中文视频-语言数据集(例如包含千万级独立视频),而这是预训练技术取得根本性成功的条件。本工作中,我们提出一种名为 VICTOR(即 VIdeo-language understanding via Contrastive mulTimOdal pRe-training,基于对比式多模态预训练的视频-语言理解)的新型视频-语言理解框架。除掩码语言建模等通用代理任务外,VICTOR 在对比学习范式下构建了若干新颖代理任务,使模型更鲁棒并能从多角度捕捉更复杂的多模态语义与结构关系。VICTOR 在大规模中文视频-语言数据集上训练,该数据集包含超过一千万条完整视频及相应高质量文本描述。我们将预训练的 VICTOR 模型应用于一系列下游任务,并对比 VideoBERT、UniVL 等当前最优预训练方法,展示了其优越性能。代码与训练所得检查点将公开,以滋养研究界的进一步发展。
引用
@article{arxiv.2104.09411,
title = {Understanding Chinese Video and Language via Contrastive Multimodal Pre-Training},
author = {Chenyi Lei and Shixian Luo and Yong Liu and Wanggui He and Jiamang Wang and Guoxin Wang and Haihong Tang and Chunyan Miao and Houqiang Li},
journal= {arXiv preprint arXiv:2104.09411},
year = {2021}
}