中文

论视觉模态在神经机器翻译中的利用

计算与语言 2019-10-08 v1 机器学习

摘要

在计算语言学中,有效利用视觉模态进行神经机器翻译(NMT)仍是一个开放问题。近期,Caglayan 等人提出,观察到的增益有限主要是由于 Multi30k 数据集(当时唯一可用的多模态 MT 数据集)中句子非常简单、简短且重复,使得源文本已足以提供上下文。在本工作中,我们在一个新的大规模多模态机器翻译(MMT)数据集 How2 上进一步验证该假设,其平均句长比 Multi30k 长 1.57 倍且无重复。我们提出并评估了三种新颖的融合技术,每种都旨在确保序列到序列转换流水线的不同阶段即便在完整语言上下文下也能利用视觉上下文。然而,在完整语言上下文下我们仍仅获得微小增益,并认为从深度视觉模型(Multi30k 用 ResNet,How2 用 ResNext)提取的视觉嵌入无助于提升 NMT 中词元级预测时词汇元素间的区分性。我们通过注意力分布分析定性地、并通过主成分分析定量地证明了这一点,得出结论:现有 MMT 数据集中需要改进的是视觉嵌入的质量而非句子长度。

关键词

引用

@article{arxiv.1910.02754,
  title  = {On Leveraging the Visual Modality for Neural Machine Translation},
  author = {Vikas Raunak and Sang Keun Choe and Quanyang Lu and Yi Xu and Florian Metze},
  journal= {arXiv preprint arXiv:1910.02754},
  year   = {2019}
}

备注

Accepted to INLG 2019