面向多模态机器翻译的跨语言视觉预训练
计算与语言
2021-04-22 v2 计算机视觉与模式识别
摘要
预训练语言模型已被证明能大幅提升许多自然语言任务的性能。尽管此类模型早期聚焦于单语言预训练,近期进展已催生跨语言与视觉预训练方法。本文中,我们结合这两种方法以学习视觉基础的跨语言表示。具体而言,我们用掩码区域分类扩展翻译语言建模(Lample and Conneau, 2019),并利用三向平行视觉与语言语料库进行预训练。我们表明,当为多模态机器翻译微调时,这些模型取得了最先进的性能。我们还定性地揭示了所学基础表示的有用性。
引用
@article{arxiv.2101.10044,
title = {Cross-lingual Visual Pre-training for Multimodal Machine Translation},
author = {Ozan Caglayan and Menekse Kuyu and Mustafa Sercan Amac and Pranava Madhyastha and Erkut Erdem and Aykut Erdem and Lucia Specia},
journal= {arXiv preprint arXiv:2101.10044},
year = {2021}
}
备注
Accepted to EACL 2021 (Camera-ready version)