中文

面向多模态机器翻译的跨语言视觉预训练

计算与语言 2021-04-22 v2 计算机视觉与模式识别

摘要

预训练语言模型已被证明能大幅提升许多自然语言任务的性能。尽管此类模型早期聚焦于单语言预训练,近期进展已催生跨语言与视觉预训练方法。本文中,我们结合这两种方法以学习视觉基础的跨语言表示。具体而言,我们用掩码区域分类扩展翻译语言建模(Lample and Conneau, 2019),并利用三向平行视觉与语言语料库进行预训练。我们表明,当为多模态机器翻译微调时,这些模型取得了最先进的性能。我们还定性地揭示了所学基础表示的有用性。

关键词

引用

@article{arxiv.2101.10044,
  title  = {Cross-lingual Visual Pre-training for Multimodal Machine Translation},
  author = {Ozan Caglayan and Menekse Kuyu and Mustafa Sercan Amac and Pranava Madhyastha and Erkut Erdem and Aykut Erdem and Lucia Specia},
  journal= {arXiv preprint arXiv:2101.10044},
  year   = {2021}
}

备注

Accepted to EACL 2021 (Camera-ready version)