一种用于神经机器翻译的基于图的新型多模态融合编码器
计算与语言
2020-07-20 v1
摘要
多模态神经机器翻译(NMT)旨在将源语言句子与图像配对翻译为目标语言。然而,主流的多模态NMT模型未能充分利用不同模态语义单元之间细粒度的语义对应关系,而后者有潜力精炼多模态表示学习。为解决此问题,本文提出一种用于NMT的基于图的新型多模态融合编码器。具体而言,我们首先使用统一的多模态图表示输入句子与图像,该图捕获多模态语义单元(词与视觉对象)之间的多种语义关系。随后我们堆叠多个基于图的多模态融合层,迭代地进行语义交互以学习节点表示。最后,这些表示为解码器提供基于注意力的上下文向量。我们在Multi30K数据集上评估所提出的编码器。实验结果及深入分析显示了我们多模态NMT模型的优越性。
引用
@article{arxiv.2007.08742,
title = {A Novel Graph-based Multi-modal Fusion Encoder for Neural Machine Translation},
author = {Yongjing Yin and Fandong Meng and Jinsong Su and Chulun Zhou and Zhengyuan Yang and Jie Zhou and Jiebo Luo},
journal= {arXiv preprint arXiv:2007.08742},
year = {2020}
}