中文

以图像应对歧义:改进多模态机器翻译与对比评估

计算与语言 2023-05-29 v2 计算机视觉与模式识别

摘要

机器翻译(MT)的主要挑战之一是歧义,在某些情况下可借助图像等伴随上下文消解。然而,近期多模态机器翻译(MMT)的研究表明,从图像中获得改进十分困难,这不仅受限于构建有效跨模态表示的难度,也受限于缺乏针对性的评估与训练数据。我们提出一种基于强文本仅译 MT 模型的新 MMT 方法,其使用神经适配器、一种新颖的引导自注意力机制,并在视觉条件掩码与 MMT 上联合训练。我们还引入 CoMMuTE,一个包含歧义句子及其可能译文的对比多语言多模态翻译评估集,并配有与每个译文相对应的消歧图像。我们的方法在标准英译法、英译德和英译捷基准上取得了与强文本仅译模型相竞争的结果,并在我们的对比测试集上大幅优于基线及最先进的 MMT 系统。我们的代码与 CoMMuTE 均已公开可用。

关键词

引用

@article{arxiv.2212.10140,
  title  = {Tackling Ambiguity with Images: Improved Multimodal Machine Translation and Contrastive Evaluation},
  author = {Matthieu Futeral and Cordelia Schmid and Ivan Laptev and Benoît Sagot and Rachel Bawden},
  journal= {arXiv preprint arXiv:2212.10140},
  year   = {2023}
}

备注

Accepted to ACL 2023