m3P:利用多模态提示实现多模态多语言翻译
计算与语言
2024-03-27 v1 人工智能
摘要
多语言翻译通过将所有语言投影到共享空间来支持多种翻译方向,但由于语言在文本单模态方面的差异,尤其在语言数量大时,会影响翻译质量。为弥合这一差距,我们引入视觉上下文作为通用的、语言无关的表示,以促进多语言翻译。本文提出一种框架,利用多模态提示引导多模态多语言神经机器翻译(Multimodal Multilingual neural Machine Translation, m3P),该框架将不同语言的表示与相同含义对齐,并生成用于翻译的条件视觉-语言记忆。我们构建了一个支持102种语言的多语言多模态指令数据集(InstrMulti102)。本方法旨在通过将图像视为中心语言来最小化不同语言的表示距离。实验结果表明,m3P显著优于以前的文本单模态基线方法和多语言多模态方法。此外,探针实验验证了该方法在低资源和大规模多语言场景下提升翻译效果的有效性。
引用
@article{arxiv.2403.17556,
title = {m3P: Towards Multimodal Multilingual Translation with Multimodal Prompt},
author = {Jian Yang and Hongcheng Guo and Yuwei Yin and Jiaqi Bai and Bing Wang and Jiaheng Liu and Xinnian Liang and Linzheng Cahi and Liqun Yang and Zhoujun Li},
journal= {arXiv preprint arXiv:2403.17556},
year = {2024}
}
备注
COLING 2024