自动后编辑能否改进神经机器翻译?
计算与语言
2020-10-01 v1
摘要
自动后编辑(APE)旨在改进机器翻译,从而减少人工后编辑工作量。APE 在与统计机器翻译(SMT)系统结合使用时取得了显著成功,但在神经机器翻译(NMT)系统上则未如此成功。这引发了关于当前场景下 APE 任务相关性的疑问。然而,APE 模型的训练严重依赖大规模人工合成语料库且仅辅以有限的人工后编辑数据。我们假设 APE 模型在改进 NMT 翻译上表现不佳是由于缺乏充分的监督。为验证该假设,我们编译了更大规模的英语到德语 NMT 人工后编辑语料库。我们通过实证表明,在该语料库上训练的最先进神经 APE 模型能显著改进一个强领域内 NMT 系统,挑战了该领域的当前认知。我们进一步研究了训练数据规模变化、使用人工合成训练数据以及领域特异性对 APE 任务的影响。我们在 CC BY-NC-SA 4.0 许可下于 https://github.com/shamilcm/pedra 发布该新语料库。
引用
@article{arxiv.2009.14395,
title = {Can Automatic Post-Editing Improve NMT?},
author = {Shamil Chollampatt and Raymond Hendy Susanto and Liling Tan and Ewa Szymanska},
journal= {arXiv preprint arXiv:2009.14395},
year = {2020}
}
备注
In EMNLP 2020