视觉想象提升多模态翻译
计算与语言
2017-07-10 v2 计算机视觉与模式识别
摘要
我们将多模态翻译分解为两个子任务:学习翻译与学习视觉接地表征。在多任务学习框架中,翻译通过基于注意力的编码器-解码器学习,而接地表征通过图像表征预测学习。与当前最优方法相比,我们的方法在 Multi30K 数据集上提升了翻译性能。此外,若我们在外部 MS COCO 数据集上训练图像预测任务,该方法同样有效;并且我们发现,若在外部 News Commentary 平行文本上训练翻译模型,性能也会提升。
引用
@article{arxiv.1705.04350,
title = {Imagination improves Multimodal Translation},
author = {Desmond Elliott and Ákos Kádár},
journal= {arXiv preprint arXiv:1705.04350},
year = {2017}
}
备注
Clarified main contributions, minor correction to Equation 8, additional comparisons in Table 2, added more related work