推进自动后期编辑的半监督学习:基于含错术语掩码填充的数据合成
计算与语言
2024-06-04 v2
摘要
由于训练数据的缺乏,利用合成数据进行训练的自监督学习已被广泛采用以开发自动后期编辑(APE)模型。为此,我们聚焦于创建高质量合成数据的数据合成方法。鉴于 APE 以可能包含错误的机器翻译结果作为输入,我们提出了一种数据合成方法,使生成的合成数据能够模拟实际数据中的翻译错误。我们引入了一种基于加噪的数据合成方法,通过改进掩码语言模型方法,用错误词元填充掩码词元从而从干净文本生成带噪文本。此外,我们提出了选择性语料交织,通过仅取有益样本组合两个独立的合成数据集,以进一步提升合成数据的质量。实验结果表明,使用我们的方法创建的合成数据所训练的 APE 性能显著优于现有方法创建的其他合成数据。
引用
@article{arxiv.2204.03896,
title = {Advancing Semi-Supervised Learning for Automatic Post-Editing: Data-Synthesis by Mask-Infilling with Erroneous Terms},
author = {Wonkee Lee and Seong-Hwan Heo and Jong-Hyeok Lee},
journal= {arXiv preprint arXiv:2204.03896},
year = {2024}
}
备注
Accepted to LREC-COLING 2024