MTNT:噪声文本机器翻译的测试平台
计算与语言
2018-09-05 v1
摘要
噪声或非标准输入文本会导致多数现代机器翻译(MT)系统产生灾难性误译,且构建噪声鲁棒 MT 系统的研究兴趣日益增长。然而,目前尚无公开可用的含自然产生噪声输入与译文的平行语料库,因此先前工作只得在合成数据集上评估。本文提出噪声文本机器翻译基准数据集(MTNT),由 Reddit(www.reddit.com)上的噪声评论与专业 sourced 译文组成。我们委托将英语评论译为法语和日语,以及将法语和日语评论译为英语,每语言对约 7k–37k 句。我们定性与定量考察该数据集所含噪声类型,进而表明现有 MT 模型在诸多噪声相关现象上表现极差,即便在少量领域内训练集上做自适应后亦然。这表明该数据集可为面向 MT 中噪声文本处理的方法提供有吸引力的测试平台。数据公开于 www.cs.cmu.edu/~pmichel1/mtnt/。
引用
@article{arxiv.1809.00388,
title = {MTNT: A Testbed for Machine Translation of Noisy Text},
author = {Paul Michel and Graham Neubig},
journal= {arXiv preprint arXiv:1809.00388},
year = {2018}
}
备注
EMNLP 2018 Long Paper