中文

UNIMO-2:端到端统一视觉-语言接地学习

计算机视觉与模式识别 2022-03-18 v1 计算与语言

摘要

视觉-语言预训练(VLP)在各种跨模态下游任务上取得了令人印象深刻的性能。然而,大多数现有方法只能从对齐的图像-描述数据学习,并严重依赖昂贵的区域特征,这极大限制了其可扩展性和性能。在本文中,我们提出一个端到端统一模态预训练框架,即UNIMO-2,用于在对齐的图像-描述数据以及未对齐的仅图像和仅文本语料库上联合学习。我们构建了一个统一Transformer模型来联合学习视觉表示、文本表示以及图像与文本之间的语义对齐。特别地,我们提出通过共享接地空间在图像和文本上执行接地学习,这有助于桥接未对齐的图像和文本,并在不同类型语料库上对齐视觉和文本语义空间。实验表明,我们的接地学习方法可改善文本和视觉语义对齐,从而提升各种跨模态任务的性能。此外,受益于对不同类型语料库的有效联合建模,我们的模型在单模态视觉和文本任务上也取得了令人印象深刻的性能。我们的代码和模型已在UNIMO项目页https://unimo-ptm.github.io/公开。

关键词

引用

@article{arxiv.2203.09067,
  title  = {UNIMO-2: End-to-End Unified Vision-Language Grounded Learning},
  author = {Wei Li and Can Gao and Guocheng Niu and Xinyan Xiao and Hao Liu and Jiachen Liu and Hua Wu and Haifeng Wang},
  journal= {arXiv preprint arXiv:2203.09067},
  year   = {2022}
}

备注

Accepted by ACL2022