通过 LLM 生成合成数据以扩展低资源机器翻译
计算与语言
2025-09-23 v2
摘要
我们研究了 LLM 生成的合成数据在改善低资源机器翻译(MT)方面的潜力。聚焦于七种不同的目标语言,我们根据英文 Europarl 构建了一个文档级合成语料库,并通过轴转将其扩展到 147 个额外的语言对。自动评估和人工评估证实了其整体高质量。我们通过以下方式研究其实际应用: 识别有效的训练机制, 将我们的数据与 HPLT 数据集进行比较, 研究改变训练数据规模的影响,以及 测试其在以英语为中心的 MT 之外的效用。最后,我们引入了 SynOPUS,一个用于合成平行数据集的公开存储库。我们的研究结果表明,LLM 生成的合成数据即使存在噪声,也能显著提高低资源语言的 MT 性能。
引用
@article{arxiv.2505.14423,
title = {Scaling Low-Resource MT via Synthetic Data Generation with LLMs},
author = {Ona de Gibert and Joseph Attieh and Teemu Vahtola and Mikko Aulamo and Zihao Li and Raúl Vázquez and Tiancheng Hu and Jörg Tiedemann},
journal= {arXiv preprint arXiv:2505.14423},
year = {2025}
}
备注
Accepted at EMNLP 2025 Main Conference