中文

视觉想象提升多模态翻译

计算与语言 2017-07-10 v2 计算机视觉与模式识别

摘要

我们将多模态翻译分解为两个子任务:学习翻译与学习视觉接地表征。在多任务学习框架中,翻译通过基于注意力的编码器-解码器学习,而接地表征通过图像表征预测学习。与当前最优方法相比,我们的方法在 Multi30K 数据集上提升了翻译性能。此外,若我们在外部 MS COCO 数据集上训练图像预测任务,该方法同样有效;并且我们发现,若在外部 News Commentary 平行文本上训练翻译模型,性能也会提升。

关键词

引用

@article{arxiv.1705.04350,
  title  = {Imagination improves Multimodal Translation},
  author = {Desmond Elliott and Ákos Kádár},
  journal= {arXiv preprint arXiv:1705.04350},
  year   = {2017}
}

备注

Clarified main contributions, minor correction to Equation 8, additional comparisons in Table 2, added more related work