中文

eSCAPE:面向自动后编辑的大规模合成语料库

计算与语言 2018-03-21 v1

摘要

训练用于自动纠正机器翻译文本的模型通常依赖于由(源文本、机器翻译、人工后编辑)三元组构成的数据,这些数据为每个源句子提供了翻译错误的示例以及人工后编辑者所做的相应纠正。理想情况下,大量此类数据应允许模型学习可靠的纠正模式,并在测试阶段有效地将其应用于未见过的(源文本、机器翻译)对。然而在实践中,此类数据的有限可用性要求解决方案在训练过程中整合其他知识源。沿此方向,最先进的(SOTA)结果最近由一些系统取得,这些系统除了利用有限数量的可用训练数据外,还利用人工语料库,通过自动翻译来近似“金标准”训练实例的元素。遵循这一思路,我们提出了 eSCAPE,这是迄今为止发布的最大规模、可免费获取的自动后编辑合成语料库。eSCAPE 包含数百万条条目,其中训练三元组的机器翻译元素是通过对公开可用的平行语料库的源语言端进行翻译获得的,并将目标语言端用作人工后编辑的替代。翻译通过基于短语的模型和神经模型获得。对于每种机器翻译范式,eSCAPE 包含 720 万条英德三元组和 330 万条英意三元组,分别总计 1440 万和 660 万条实例。通过在通用领域场景(自动后编辑最具挑战性的场景)中的实验,证明了 eSCAPE 的有效性。对于两个语言方向,基于我们的人工数据训练的模型始终能以统计上显著的增益提升机器翻译质量。eSCAPE 的当前版本可从以下网址免费下载:http://hltshare.fbk.eu/QT21/eSCAPE.html。

关键词

引用

@article{arxiv.1803.07274,
  title  = {eSCAPE: a Large-scale Synthetic Corpus for Automatic Post-Editing},
  author = {Matteo Negri and Marco Turchi and Rajen Chatterjee and Nicola Bertoldi},
  journal= {arXiv preprint arXiv:1803.07274},
  year   = {2018}
}

备注

Accepted at LREC 2018