中文

编码过程中调制并关注源图像可改进多模态翻译

计算与语言 2018-06-01 v1

摘要

我们提出了一种全新的完全端到端多模态翻译方法,其中源文本编码器利用条件批归一化调制整个视觉输入处理过程,以计算对任务最具信息量的图像特征。此外,我们基于这一原始思想提出了一种新的注意力机制,其中视觉输入的注意力模型以源文本编码器表示为条件。文中我们详述了模型及图像分析流程。最后,我们报告实验结果。据我们所知,其在三个不同测试集上均达到了新的state of the art。

关键词

引用

@article{arxiv.1712.03449,
  title  = {Modulating and attending the source image during encoding improves Multimodal Translation},
  author = {Jean-Benoit Delbrouck and Stéphane Dupont},
  journal= {arXiv preprint arXiv:1712.03449},
  year   = {2018}
}

备注

Accepted at NIPS Workshop