中文

LVP-M3:面向多语言多模态机器翻译的语言感知视觉提示

计算与语言 2022-11-29 v2 人工智能

摘要

多模态机器翻译(MMT)致力于利用视觉特征增强纯文本翻译,已引起自然语言处理和计算机视觉领域的广泛关注。近期进展仍难以为每种语言对训练单独模型,当现实世界中语言数量增加时,这种做法成本高昂且难以承受。换言之,多语言多模态机器翻译(Multilingual MMT)任务尚未被研究,其旨在通过为多种语言提供共享语义空间来解决上述问题。此外,图像模态没有语言边界,在弥合语言间语义鸿沟方面具有优势。为此,我们首先通过建立涵盖七种语言的两个新多语言MMT基准数据集,提出了多语言MMT任务。然后,提出一种使用视觉提示的有效基线LVP-M3以支持不同语言间的翻译,其包含三个阶段(词元编码、语言感知视觉提示生成和语言翻译)。在我们构建的基准数据集上的大量实验结果证明了LVP-M3方法在多语言MMT上的有效性。

关键词

引用

@article{arxiv.2210.15461,
  title  = {LVP-M3: Language-aware Visual Prompt for Multilingual Multimodal Machine Translation},
  author = {Hongcheng Guo and Jiaheng Liu and Haoyang Huang and Jian Yang and Zhoujun Li and Dongdong Zhang and Zheng Cui and Furu Wei},
  journal= {arXiv preprint arXiv:2210.15461},
  year   = {2022}
}

备注

Accepted by EMNLP 2022