中文

用于英日多模态神经机器翻译的可比句对语料库

计算与语言 2020-10-20 v1 人工智能 计算机视觉与模式识别

摘要

多年来,多模态神经机器翻译(NMT)已成为一个日益重要的研究领域,因为图像数据等额外模态可为文本数据提供更多上下文。此外,由于带有图像的平行句对可用性低(尤其是英日数据),在无大型平行语料情况下训练多模态 NMT 模型的可行性仍在持续研究中。然而,这一空白可由包含双语术语和平行短语的可比句对填补,这些句子通过社交网络帖子和电商产品描述等媒体自然产生。本文提出一个由现有图像描述数据集编译而成的含可比句对的英日多模态新语料库。此外,我们为验证和测试目的用较小的平行语料补充了可比句对。为测试该可比句翻译场景的性能,我们用可比语料训练了若干基线 NMT 模型并评估其英日翻译性能。由于基线实验翻译分数较低,我们认为当前多模态 NMT 模型并非为有效利用可比句数据而设计。尽管如此,我们希望该语料库能被用于推进基于可比句的多模态 NMT 研究。

关键词

引用

@article{arxiv.2010.08725,
  title  = {A Corpus for English-Japanese Multimodal Neural Machine Translation with Comparable Sentences},
  author = {Andrew Merritt and Chenhui Chu and Yuki Arase},
  journal= {arXiv preprint arXiv:2010.08725},
  year   = {2020}
}