中文

对比视觉语言预训练

计算机视觉与模式识别 2020-07-28 v1 图像与视频处理

摘要

近期提出了几种多模态表示学习方法,如 LXMERT 和 ViLBERT。由于在大规模多模态预训练期间捕获了高级语义信息,这些方法能够取得优异的性能。然而,由于在 Visual Genome 数据集上预训练的视觉特征,ViLBERT 和 LXMERT 采用视觉区域回归和分类损失,它们经常面临领域差异和噪声标签问题。为了克服这些问题,我们提出了无偏的对比视觉语言预训练(CVLP),其构建了基于对比学习的视觉自监督损失。我们在几个下游任务上评估了 CVLP,包括 VQA、GQA 和 NLVR2,以验证对比学习在多模态表示学习上的优越性。我们的代码可在以下地址获取:https://github.com/ArcherYunDong/CVLP-。

关键词

引用

@article{arxiv.2007.13135,
  title  = {Contrastive Visual-Linguistic Pretraining},
  author = {Lei Shi and Kai Shuang and Shijie Geng and Peng Su and Zhengkai Jiang and Peng Gao and Zuohui Fu and Gerard de Melo and Sen Su},
  journal= {arXiv preprint arXiv:2007.13135},
  year   = {2020}
}