自动后期编辑的实证研究
计算与语言
2022-09-19 v1
摘要
自动后期编辑(APE)旨在通过自动纠正机器翻译输出中的错误来减少人工后期编辑工作量。由于人工标注训练数据量有限,数据稀缺是所有 APE 系统面临的主要挑战之一。为缓解真实训练数据的不足,当前大多数 APE 系统采用数据增强方法生成大规模人工语料。鉴于数据增强在 APE 中的重要性,我们分别研究了人工语料的构建方法与人工数据领域对 APE 模型性能的影响。此外,不同机器翻译(MT)系统间 APE 的难度各异。我们在一个困难的 APE 数据集上研究了 SOTA APE 模型的输出,以分析现有 APE 系统的问题。主要发现如下:1)具有高质量源文本与机器翻译文本的人工语料更能有效提升 APE 模型性能;2)领域内人工训练数据能更好提升 APE 模型性能,而不相关的域外数据实际上会干扰模型;3)现有 APE 模型在处理含长源文本或高质量机器翻译文本的案例时表现不佳;4)SOTA APE 模型在语法与语义增删问题上表现良好,但输出易出现实体与语义遗漏错误。
引用
@article{arxiv.2209.07759,
title = {An Empirical Study of Automatic Post-Editing},
author = {Xu Zhang and Xiaojun Wan},
journal= {arXiv preprint arXiv:2209.07759},
year = {2022}
}
备注
14 pages, 4 figures