人工译文的自动校正
计算与语言
2022-06-20 v1 机器学习
摘要
我们提出翻译错误校正(TEC),即自动校正人工生成的译文的任务。机器翻译(MT)的不完善长期以来推动了利用自动后编辑事后改进译文的系统。相比之下,尽管直觉上人类会犯下机器非常适合协助纠正的独特错误(从错别字到翻译规范的不一致),自动校正人工译文的问题却很少受到关注。为此,我们构建并发布了带有三个 TEC 数据集的 Aced 语料库。我们表明,TEC 中的人类错误比自动后编辑数据集中的 MT 错误表现出更多样化的错误类型且流畅性错误远少,这表明需要专门的 TEC 模型来纠正人类错误。我们表明,基于人类错误合成的错误进行预训练可将 TEC 的 F 值提高多达 5.1 个点。我们对九名专业翻译编辑进行了人在回路的用户研究,发现我们的 TEC 系统的辅助使他们产出了显著更高质量的修订译文。
引用
@article{arxiv.2206.08593,
title = {Automatic Correction of Human Translations},
author = {Jessy Lin and Geza Kovacs and Aditya Shastry and Joern Wuebker and John DeNero},
journal= {arXiv preprint arXiv:2206.08593},
year = {2022}
}
备注
NAACL 2022. Dataset available at: https://github.com/lilt/tec