中文

UNITER:通用图像-文本表示学习

计算机视觉与模式识别 2020-07-21 v3 计算与语言 机器学习

摘要

联合图像-文本嵌入是大多数视觉与语言(V+L)任务的基石,其中多模态输入被同时处理以进行联合视觉与文本理解。在本文中,我们介绍了 UNITER,一种通用图像-文本表示(UNiversal Image-TExt Representation),通过对四个图像-文本数据集(COCO、Visual Genome、Conceptual Captions 和 SBU Captions)的大规模预训练学习得到,它可以用联合多模态嵌入为异构的下游 V+L 任务提供支撑。我们设计了四个预训练任务:掩码语言建模(MLM)、掩码区域建模(MRM,含三种变体)、图像-文本匹配(ITM)和词-区域对齐(WRA)。不同于先前工作对两种模态施加联合随机掩码,我们在预训练任务上使用条件掩码(即掩码语言/区域建模以对图像/文本的完全观测为条件)。除了用于全局图像-文本对齐的 ITM 外,我们还通过最优传输(OT)提出 WRA,以在预训练期间显式鼓励词与图像区域之间的细粒度对齐。综合分析表明条件掩码和基于 OT 的 WRA 都有助于更好的预训练。我们还进行了彻底的消融研究以找到预训练任务的最优组合。大量实验表明 UNITER 在六个 V+L 任务(九个以上数据集)上取得了新的 SOTA,包括视觉问答、图像-文本检索、指代表达理解、视觉常识推理、视觉蕴含和 NLVR2^2。代码见 https://github.com/ChenRocks/UNITER。

关键词

引用

@article{arxiv.1909.11740,
  title  = {UNITER: UNiversal Image-TExt Representation Learning},
  author = {Yen-Chun Chen and Linjie Li and Licheng Yu and Ahmed El Kholy and Faisal Ahmed and Zhe Gan and Yu Cheng and Jingjing Liu},
  journal= {arXiv preprint arXiv:1909.11740},
  year   = {2020}
}

备注

ECCV 2020