具有图像与文本潜在语义的神经机器翻译
计算与语言
2016-11-28 v1
摘要
尽管基于注意力的神经机器翻译取得了巨大成功,但注意力机制无法捕捉源句子的完整含义,因为注意力机制生成目标词时严重依赖于源句子的相关部分。早期研究的报告引入了潜在变量来捕获句子的完整含义,并在基于注意力的神经机器翻译上取得了改进。我们遵循这种方法,并且认为句子含义的捕获受益于图像信息,因为人类不仅从文本信息而且从视觉等感知信息理解语言的含义。正如本文所述,我们提出了一种引入包含从文本和图像中提取的底层语义的连续潜在变量的神经机器翻译模型。我们的模型可以端到端训练,仅在训练时需要图像信息。使用英德翻译任务进行的实验表明,我们的模型优于基线。
引用
@article{arxiv.1611.08459,
title = {Neural Machine Translation with Latent Semantic of Image and Text},
author = {Joji Toyama and Masanori Misono and Masahiro Suzuki and Kotaro Nakayama and Yutaka Matsuo},
journal= {arXiv preprint arXiv:1611.08459},
year = {2016}
}