中文

通过合成数据和语言特定预处理提升原住民语言机器翻译

计算与语言 2026-05-21 v2

摘要

低资源原住民语言常缺乏用于有效神经机器翻译 (NMT) 的平行语料。合成数据生成是缓解此限制在数据稀缺环境中实用的策略。本文通过使用高容量多语言翻译模型生成的合成句子对,扩充了美洲原住民语言的精选平行数据集。我们在仅使用精选数据和合成数据增强的数据上微调多语言 mBART 模型,并使用最近美洲 NLP 共享任务用于粘性语言的首要指标 chrF++ 评估翻译质量。我们进一步应用语言特定的预处理,包括正规化的文字规范化和噪声感知过滤,以减少语料库中的人工物。针对 Guarani-Spanish 和 Quechua-Spanish 翻译实验显示,合成数据增强在 chrF++ 上 consistently 获得改进,而针对 Aymara 的诊断实验则突显了通用预处理对高度粘性语言的局限性。

关键词

引用

@article{arxiv.2601.03135,
  title  = {Improving Indigenous Language Machine Translation with Synthetic Data and Language-Specific Preprocessing},
  author = {Aashish Dhawan and Christopher Driggers-Ellis and Christan Grant and Daisy Zhe Wang},
  journal= {arXiv preprint arXiv:2601.03135},
  year   = {2026}
}