中文

Unicoder-VL:一种基于跨模态预训练的视觉与语言通用编码器

计算机视觉与模式识别 2019-12-04 v3

摘要

我们提出 Unicoder-VL,一种旨在通过预训练方式学习视觉与语言联合表示的通用编码器。借鉴 XLM 和 Unicoder 等跨语言预训练模型的思想,将视觉与语言内容一同输入多层 Transformer 进行跨模态预训练,其中采用了三个预训练任务,包括掩码语言建模(MLM)、掩码目标分类(MOC)和视觉-语言匹配(VLM)。前两个任务基于语言和视觉内容联合学习输入词元的上下文感知表示。最后一个任务试图预测图像与文本是否相互描述。在大规模图像-标题对上预训练后,我们仅添加一个额外输出层便将 Unicoder-VL 迁移至基于标题的图像-文本检索和视觉常识推理任务。我们在两个任务上均取得了最先进或可比的结果,并展示了跨模态预训练的强大能力。

关键词

引用

@article{arxiv.1908.06066,
  title  = {Unicoder-VL: A Universal Encoder for Vision and Language by Cross-modal Pre-training},
  author = {Gen Li and Nan Duan and Yuejian Fang and Ming Gong and Daxin Jiang and Ming Zhou},
  journal= {arXiv preprint arXiv:1908.06066},
  year   = {2019}
}

备注

accepted by AAAI-2020. arXiv admin note: text overlap with arXiv:1909.11740 by other authors