中文

基于检索的多粒度对齐的无监督视觉-语言预训练

计算机视觉与模式识别 2022-03-02 v1 人工智能 计算与语言 多媒体

摘要

视觉-语言 (V+L) 预训练模型近年来在各种多模态基准上取得了巨大成功。然而,大多数现有模型需要在大量并行图像-文本数据上预训练,与仅图像或仅文本数据相比,收集此类数据成本高昂。在本文中,我们探索无监督视觉-语言预训练 (UVLP),以从非并行图像和文本数据集中学习跨模态表示。我们发现了在无并行数据情况下实现良好无监督 V+L 预训练的两个关键因素:(i) 联合图像-文本输入,(ii) 整体图像-文本对齐(即使对于非并行数据)。相应地,我们提出了一种针对非并行文本和图像的新颖无监督 V+L 预训练课程。我们首先通过基于检索的方法构建弱对齐的图像-文本语料库,然后应用一组多粒度对齐预训练任务,包括区域到标签、区域到短语以及图像到句子对齐,以弥合两种模态之间的差距。全面的消融研究表明每种粒度都有助于学习更强的预训练模型。我们将预训练模型适配到一组 V+L 下游任务,包括 VQA、NLVR2、Visual Entailment 和 RefCOCO+。在无监督设定下,我们的模型在所有这些任务上都取得了最先进的性能。

关键词

引用

@article{arxiv.2203.00242,
  title  = {Unsupervised Vision-and-Language Pre-training via Retrieval-based Multi-Granular Alignment},
  author = {Mingyang Zhou and Licheng Yu and Amanpreet Singh and Mengjiao Wang and Zhou Yu and Ning Zhang},
  journal= {arXiv preprint arXiv:2203.00242},
  year   = {2022}
}

备注

First two authors contributed equally. 13 pages, 11 figures