中文

MTNT:噪声文本机器翻译的测试平台

计算与语言 2018-09-05 v1

摘要

噪声或非标准输入文本会导致多数现代机器翻译(MT)系统产生灾难性误译,且构建噪声鲁棒 MT 系统的研究兴趣日益增长。然而,目前尚无公开可用的含自然产生噪声输入与译文的平行语料库,因此先前工作只得在合成数据集上评估。本文提出噪声文本机器翻译基准数据集(MTNT),由 Reddit(www.reddit.com)上的噪声评论与专业 sourced 译文组成。我们委托将英语评论译为法语和日语,以及将法语和日语评论译为英语,每语言对约 7k–37k 句。我们定性与定量考察该数据集所含噪声类型,进而表明现有 MT 模型在诸多噪声相关现象上表现极差,即便在少量领域内训练集上做自适应后亦然。这表明该数据集可为面向 MT 中噪声文本处理的方法提供有吸引力的测试平台。数据公开于 www.cs.cmu.edu/~pmichel1/mtnt/。

关键词

引用

@article{arxiv.1809.00388,
  title  = {MTNT: A Testbed for Machine Translation of Noisy Text},
  author = {Paul Michel and Graham Neubig},
  journal= {arXiv preprint arXiv:1809.00388},
  year   = {2018}
}

备注

EMNLP 2018 Long Paper