面向语言对稀有语种的半合成平行数据:机器翻译质量评估的数据集构建案例研究
计算与语言
2026-03-13 v1
摘要
质量评估(QE)在机器翻译(MT)工作流程中发挥着关键作用,因其用于评估无参考翻译的生成输出,并确定是否需要人工后编辑或完整重新翻译。然而,针对稀有语言对开发高度准确、可适应且可靠的 QE 系统仍基本未解,主要原因是平行语料有限,以及语言相关的多样化因素,如高度语法复杂的语言。本研究提出一种面向英-希伯来语 QE 的半合成平行数据集,通过创建典型语言模式的英语句子,分别使用多个 MT 引擎翻译成希伯来语,并通过 BLEU 基于选择进行筛选。每段翻译内容均由语言学家手动评估并打分,我们还整合了来自自身资源的专业英-希伯来语平行片段,赋予最高质量分数。我们引入受控翻译错误以解决语言挑战,特别是关于性别和数共价的问题,并在此数据集上训练神经 QE 模型,包括 BERT 和 XLM-R,以评估句子级 MT 质量。我们的发现突显了数据集规模、分布平衡以及错误分布对模型性能的影响。我们将描述实验的挑战、方法和结果,并阐明旨在提高 QE 性能的未来方向。这一研究推动了针对稀有语言对,包括高度语法复杂语言的 QE 模型发展。
引用
@article{arxiv.2603.11743,
title = {Semi-Synthetic Parallel Data for Translation Quality Estimation: A Case Study of Dataset Building for an Under-Resourced Language Pair},
author = {Assaf Siani and Anna Kernerman and Ilan Kernerman},
journal= {arXiv preprint arXiv:2603.11743},
year = {2026}
}