中文

UNIMO:基于跨模态对比学习迈向统一模态理解与生成

计算与语言 2022-03-15 v4

摘要

已有的预训练方法要么聚焦于单模态任务,要么聚焦于多模态任务,无法有效相互适应。它们只能利用单模态数据(即文本或图像)或有限的多模态数据(即图文对)。在本工作中,我们提出一种统一模态预训练架构,即 UNIMO,它能够有效适应单模态与多模态的理解和生成任务。大规模的自由文本语料和图像集合可用于提升视觉与文本理解能力,并且跨模态对比学习(CMCL)被用以在图文对语料上将文本与视觉信息对齐到统一语义空间中。由于非配对单模态数据极为丰富,我们的模型能够利用更大规模的数据学习更具泛化性的表示。此外,文本知识与视觉知识可在统一语义空间中相互增强。实验结果表明,UNIMO 显著提升了若干单模态与多模态下游任务的性能。我们的代码与预训练模型已在 UNIMO 项目页 https://unimo-ptm.github.io/ 公开。

关键词

引用

@article{arxiv.2012.15409,
  title  = {UNIMO: Towards Unified-Modal Understanding and Generation via Cross-Modal Contrastive Learning},
  author = {Wei Li and Can Gao and Guocheng Niu and Xinyan Xiao and Hao Liu and Jiachen Liu and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2012.15409},
  year   = {2022}
}

备注

The paper has been accepted by the main conference of ACL2021 as a long paper