中文

CoCo-BERT:通过对比跨模态匹配与去噪改进视频-语言预训练

计算机视觉与模式识别 2021-12-15 v1 人工智能 计算与语言 多媒体

摘要

BERT 类结构引发了视觉-语言预训练的革命,并在众多视觉-语言下游任务上取得了最先进的结果。现有方法主要利用带有掩码 token 的多模态输入来触发基于掩码的代理预训练任务(例如掩码语言建模和掩码物体/帧预测)。在本文中,我们认为这种掩码输入不可避免地会给跨模态匹配代理任务引入噪声,从而使固有的视觉-语言关联得不到充分探索。作为替代方案,我们推导出一种用于视频-语言预训练的特殊形式的跨模态代理目标,即对比跨模态匹配与去噪(CoCo)。通过将掩码帧/词序列视为主干未掩码序列的噪声增强,CoCo 以对比方式在掩码与未掩码输入之间同时追求模态间匹配与模态内去噪,从而加强视频-语言关联。我们的 CoCo 代理目标可进一步集成到任意 BERT 类编码器-解码器结构中用于视频-语言预训练,称为对比跨模态 BERT(CoCo-BERT)。我们在 TV 数据集和一个新收集的大规模 GIF 视频数据集(ACTION)上预训练 CoCo-BERT。通过对广泛下游任务(例如跨模态检索、视频问答和视频字幕生成)的大量实验,我们证明了 CoCo-BERT 作为一种预训练结构的优越性。

关键词

引用

@article{arxiv.2112.07515,
  title  = {CoCo-BERT: Improving Video-Language Pre-training with Contrastive Cross-modal Matching and Denoising},
  author = {Jianjie Luo and Yehao Li and Yingwei Pan and Ting Yao and Hongyang Chao and Tao Mei},
  journal= {arXiv preprint arXiv:2112.07515},
  year   = {2021}
}

备注

ACM Multimedia 2021