中文

大规模自动后编辑及其对机器翻译评估偏差的启示

计算与语言 2019-06-17 v2

摘要

本工作中,我们训练了一个自动后编辑(APE)模型,并用它揭示标准机器翻译(MT)评估流程中的偏差。我们的 APE 模型旨在纠正翻译过程引入的典型错误,并将“翻译体”输出转换为自然文本。我们的 APE 模型完全在经英语往返翻译的单语数据上训练,以模拟与 NMT 所引入错误相似的错误。我们将模型应用于现有 NMT 系统的输出,并证明尽管人工评判质量在所有情况下均有提升,但 BLEU 分数在正向翻译测试集上出现下降。我们在 WMT18 英德、WMT15 英法以及 WMT16 英罗任务上验证了这些结果。此外,我们有选择地将 APE 模型应用于近期 WMT 评测活动顶尖提交系统的输出。我们在所有任务上均观察到最高达 2.5 个 BLEU 点的质量提升。

关键词

引用

@article{arxiv.1904.04790,
  title  = {APE at Scale and its Implications on MT Evaluation Biases},
  author = {Markus Freitag and Isaac Caswell and Scott Roy},
  journal= {arXiv preprint arXiv:1904.04790},
  year   = {2019}
}

备注

Accepted at WMT 2019