利用合成偏好数据改进大语言模型的机器翻译能力
计算与语言
2025-08-22 v1
摘要
大语言模型已成为有效的机器翻译系统。本文探讨如何利用相对较少且易于生成的数据资源,改进通用的指令微调大语言模型以用于机器翻译。以斯洛文尼亚语为例,我们在公开数据集中通过程序化筛选与增强得到的子集上,利用直接偏好优化(DPO)训练改进了 GaMS-9B-Instruct 模型。由于 DPO 需要质量排序的实例对,我们使用 GaMS-9B-Instruct 和 EuroLLM-9B-Instruct 两个 LLM 翻译英文维基百科文章,以此生成其训练数据集。我们结合启发式方法与 COMET 等自动评估指标对所得翻译进行排序。评估表明,我们的微调模型优于参与数据集生成的两个模型。与基线模型相比,在翻译维基百科文章时,微调模型的 COMET 分数分别提升了约 0.04 和 0.02,且能更稳定地避免语言和格式错误。
引用
@article{arxiv.2508.14951,
title = {Improving LLMs for Machine Translation Using Synthetic Preference Data},
author = {Dario Vajda and Domen Vreš and Marko Robnik-Šikonja},
journal= {arXiv preprint arXiv:2508.14951},
year = {2025}
}
备注
Paper with individual presentation at LUHME workshop at ECAI 2025