面向多模态机器翻译的动态上下文引导胶囊网络
计算与语言
2020-09-07 v1 多媒体
摘要
多模态机器翻译(MMT)主要致力于利用视觉特征增强纯文本翻译,已引起计算机视觉与自然语言处理领域的广泛关注。当前多数 MMT 模型借助注意力机制、全局上下文建模或多模态联合表示学习来利用视觉特征。然而,注意力机制缺乏模态间充分的语义交互,而后两者提供固定的视觉上下文,难以适应生成翻译时所观察到的变异性建模。为解决上述问题,本文提出一种用于 MMT 的新型动态上下文引导胶囊网络(DCCN)。具体而言,在解码的每个时间步,我们首先采用常规的源-目标注意力产生特定于该时间步的源端上下文向量。接着,DCCN 将该向量作为输入,并通过上下文引导的动态路由机制迭代提取相关视觉特征。特别地,我们用全局与区域视觉特征表示输入图像,并引入两个并行 DCCN 以不同粒度建模含视觉特征的多模态上下文向量。最终,我们得到两个多模态上下文向量,将其融合后送入解码器以预测目标词。在 Multi30K 英德与英法翻译数据集上的实验结果证明了 DCCN 的优越性。我们的代码见 https://github.com/DeepLearnXMU/MM-DCCN。
引用
@article{arxiv.2009.02016,
title = {Dynamic Context-guided Capsule Network for Multimodal Machine Translation},
author = {Huan Lin and Fandong Meng and Jinsong Su and Yongjing Yin and Zhengyuan Yang and Yubin Ge and Jie Zhou and Jiebo Luo},
journal= {arXiv preprint arXiv:2009.02016},
year = {2020}
}