中文

以少胜多:构建低资源机器翻译平行语料库需源端数据筛选

计算与语言 2026-03-12 v2

摘要

数据筛选是机器翻译训练范式中一个关键但研究不足的步骤。为了训练翻译系统,数据获取主要依赖于人工翻译和数字平行资源,或者在有限程度上依赖合成生成。但是,对于低资源语言,通过人工翻译生成充足的数据成本过高。因此,开发一个筛选源语言句子的框架以形成高效的平行文本,从而确保低资源环境下 MT 系统的最佳性能,是至关重要的。我们通过评估英印双语对来解决这个问题,以确定用于最佳 MT 系统训练的有效句子选择策略。我们经过广泛测试的框架 LALITA(词汇与语言学信息驱动的文本分析)利用词汇和语言学特征进行源句子选择,以筛选平行语料库。我们发现,通过主要在现有和合成数据集的复杂句子上进行训练,我们的方法显著提高了翻译质量。我们通过使用 50K 到 800K 英语句子的筛选数据集来模拟低资源数据可用性对此进行了测试,并报告在所有数据规模上均取得了性能提升。LALITA 展现出卓越的效率,在多种语言(印地语、奥里亚语、尼泊尔语、挪威尼诺斯克语和德语)中将数据需求减少了一半以上。这种方法不仅通过减少训练数据需求降低了 MT 系统的训练成本,还展示了 LALITA 在数据增强方面的效用。

关键词

引用

@article{arxiv.2601.08629,
  title  = {Get away with less: Need of source side data curation to build parallel corpus for low resource Machine Translation},
  author = {Saumitra Yadav and Manish Shrivastava},
  journal= {arXiv preprint arXiv:2601.08629},
  year   = {2026}
}

备注

Under Review