中文

基于多媒体枢轴的多模态编码器-解码器网络实现零资源机器翻译

计算与语言 2017-07-25 v3 人工智能 计算机视觉与模式识别 多媒体

摘要

我们提出一种方法,利用文本和图像上的多模态嵌入表示,构建一个无监督资源(即无平行语料库)的神经机器翻译系统。基于文本文档通常可能伴有与内容某种程度上相关的其他多媒体信息(如图像)这一假设,我们尝试间接估计两种语言之间的相关性。使用多媒体作为“枢轴”,我们将所有模态投影到一个共同的隐藏空间中,在该空间中,属于相似语义概念的样本应彼此靠近,无论每个样本的观测空间是什么。这种模态无关的表示是弥合不同模态间差距的关键。在其上放置一个解码器,我们的网络可以灵活地从任何输入模态生成输出。值得注意的是,在测试阶段,我们仅需要源语言文本作为翻译的输入。在实验中,我们在两个基准上测试了我们的方法,表明其可以实现合理的翻译性能。我们比较并研究了若干可能的实现方式,发现一个同时优化多模态编码器中的排序损失和解码器中的交叉熵损失的端到端模型表现最佳。

关键词

引用

@article{arxiv.1611.04503,
  title  = {Zero-resource Machine Translation by Multimodal Encoder-decoder Network with Multimedia Pivot},
  author = {Hideki Nakayama and Noriki Nishida},
  journal= {arXiv preprint arXiv:1611.04503},
  year   = {2017}
}

备注

Some error corrections in Sect.2.2 and Table 5, Machine Translation, 2017