中文

探究多模态机器翻译中对视觉上下文的需求

计算与语言 2019-06-04 v2

摘要

当前关于多模态机器翻译(MMT)的研究认为视觉模态要么不必要,要么仅边际有益。我们假定这是由于该任务唯一可用数据集(Multi30K)中使用的句子非常简单、简短且重复,使得源文本足以作为上下文。然而,在一般情况下,我们认为有可能结合视觉与文本信息以夯实翻译。在本文中,我们通过系统性分析来探究视觉模态对最先进MMT模型的贡献,其中我们部分剥夺模型的源侧文本上下文。我们的结果表明,在有限文本上下文下,模型能够利用视觉输入生成更好的翻译。这与当前认为MMT模型因图像特征质量或其特征融入模型的方式而忽视视觉模态的观点相矛盾。

关键词

引用

@article{arxiv.1903.08678,
  title  = {Probing the Need for Visual Context in Multimodal Machine Translation},
  author = {Ozan Caglayan and Pranava Madhyastha and Lucia Specia and Loïc Barrault},
  journal= {arXiv preprint arXiv:1903.08678},
  year   = {2019}
}

备注

Accepted to NAACL-HLT 2019, reviewer comments addressed, camera-ready