中文

UC2:通用跨语言跨模态视觉与语言预训练

计算机视觉与模式识别 2021-04-02 v1

摘要

视觉与语言预训练在学习视觉与语言之间的多模态表示方面已取得令人瞩目的成功。为将这一成功推广到非英语语言,我们引入 UC2,首个用于跨语言跨模态表示学习的机器翻译增强框架。为解决图像数据集多语言标注稀缺的问题,我们首先通过机器翻译(MT)用其他语言扩充现有的仅英语数据集。然后将标准的掩码语言建模和图像-文本匹配训练目标扩展到多语言设置,其中不同语言间的对齐通过共享视觉上下文(即以图像为枢轴)来捕获。为促进图像与所有目标语言的联合嵌入空间学习,我们进一步提出两个新颖的预训练任务,即掩码区域到词元建模(MRTM)和视觉翻译语言建模(VTLM),利用 MT 增强的翻译数据。在多语言图像-文本检索和多语言视觉问答基准上的评估表明,我们提出的框架在各种非英语基准上达到了新的 SOTA,同时在英语任务上保持与单语言预训练模型相当的性能。

关键词

引用

@article{arxiv.2104.00332,
  title  = {UC2: Universal Cross-lingual Cross-modal Vision-and-Language Pre-training},
  author = {Mingyang Zhou and Luowei Zhou and Shuohang Wang and Yu Cheng and Linjie Li and Zhou Yu and Jingjing Liu},
  journal= {arXiv preprint arXiv:2104.00332},
  year   = {2021}
}