中文

审视冰山一角:面向习语翻译的数据集

计算与语言 2018-02-14 v1

摘要

神经机器翻译(NMT)近年被广泛使用,在许多语言对上取得显著改进。尽管最先进的NMT系统正生成渐佳的译文,习语翻译仍是该领域未解挑战之一。习语作为多词表达式的一类,是一种有趣的语言现象,其整体意义无法由各部分意义组合而得。首要重要挑战在于缺乏用于学习与评估习语翻译的专用数据集。本文通过创建首个大规模习语翻译数据集来解决此问题。我们的数据集自动提取自广泛使用的德英翻译语料库,且对每个语言方向均包含一个所有句子含习语的目标评测集,以及一个含习语句子被标注的常规训练语料库。我们发布该数据集并用作初步NMT实验,作为迈向更优习语翻译的第一步。

关键词

引用

@article{arxiv.1802.04681,
  title  = {Examining the Tip of the Iceberg: A Data Set for Idiom Translation},
  author = {Marzieh Fadaee and Arianna Bisazza and Christof Monz},
  journal= {arXiv preprint arXiv:1802.04681},
  year   = {2018}
}

备注

Accepted at LREC 2018