审视冰山一角:面向习语翻译的数据集
计算与语言
2018-02-14 v1
摘要
神经机器翻译(NMT)近年被广泛使用,在许多语言对上取得显著改进。尽管最先进的NMT系统正生成渐佳的译文,习语翻译仍是该领域未解挑战之一。习语作为多词表达式的一类,是一种有趣的语言现象,其整体意义无法由各部分意义组合而得。首要重要挑战在于缺乏用于学习与评估习语翻译的专用数据集。本文通过创建首个大规模习语翻译数据集来解决此问题。我们的数据集自动提取自广泛使用的德英翻译语料库,且对每个语言方向均包含一个所有句子含习语的目标评测集,以及一个含习语句子被标注的常规训练语料库。我们发布该数据集并用作初步NMT实验,作为迈向更优习语翻译的第一步。
引用
@article{arxiv.1802.04681,
title = {Examining the Tip of the Iceberg: A Data Set for Idiom Translation},
author = {Marzieh Fadaee and Arianna Bisazza and Christof Monz},
journal= {arXiv preprint arXiv:1802.04681},
year = {2018}
}
备注
Accepted at LREC 2018