中文

通过 LLM 生成合成数据以扩展低资源机器翻译

计算与语言 2025-09-23 v2

摘要

我们研究了 LLM 生成的合成数据在改善低资源机器翻译(MT)方面的潜力。聚焦于七种不同的目标语言,我们根据英文 Europarl 构建了一个文档级合成语料库,并通过轴转将其扩展到 147 个额外的语言对。自动评估和人工评估证实了其整体高质量。我们通过以下方式研究其实际应用: 识别有效的训练机制, 将我们的数据与 HPLT 数据集进行比较, 研究改变训练数据规模的影响,以及 测试其在以英语为中心的 MT 之外的效用。最后,我们引入了 SynOPUS,一个用于合成平行数据集的公开存储库。我们的研究结果表明,LLM 生成的合成数据即使存在噪声,也能显著提高低资源语言的 MT 性能。

关键词

引用

@article{arxiv.2505.14423,
  title  = {Scaling Low-Resource MT via Synthetic Data Generation with LLMs},
  author = {Ona de Gibert and Joseph Attieh and Teemu Vahtola and Mikko Aulamo and Zihao Li and Raúl Vázquez and Tiancheng Hu and Jörg Tiedemann},
  journal= {arXiv preprint arXiv:2505.14423},
  year   = {2025}
}

备注

Accepted at EMNLP 2025 Main Conference