将全局视觉特征融入基于注意力的神经机器翻译
计算与语言
2017-01-24 v1
摘要
我们提出多模态、基于注意力的神经机器翻译(NMT)模型,其将视觉特征融入编码器和解码器的不同部分。我们利用通过预训练卷积神经网络提取的全局图像特征,并将其(i)作为源句子中的词,(ii)用于初始化编码器隐藏状态,(iii)作为额外数据初始化解码器隐藏状态。在实验中,我们评估这些融入全局图像特征的不同策略的比较及哪些表现最佳。我们还研究添加合成多模态多语言数据带来的影响,发现额外数据对多模态模型有积极影响。我们报告了新的最先进(SOTA)结果,并且根据所有评估指标,我们的最佳模型在 Multi30k 数据集上训练的可比较的基于短语的统计机器翻译(PBSMT)模型上也显著提升。据我们所知,这是首次纯神经模型在该数据集上所有评估指标显著超越 PBSMT 模型。
引用
@article{arxiv.1701.06521,
title = {Incorporating Global Visual Features into Attention-Based Neural Machine Translation},
author = {Iacer Calixto and Qun Liu and Nick Campbell},
journal= {arXiv preprint arXiv:1701.06521},
year = {2017}
}
备注
8 pages (11 including references), 5 figures