借助大型语言模型提升多对多多语言机器翻译
计算与语言
2024-02-08 v2
摘要
机器翻译的训练范式已逐渐从使用大量平行语料库学习神经机器翻译(NMT)模型,转变为利用高质量翻译对在多语言大型语言模型(LLMs)上进行指令微调。在本文中,我们专注于提升 LLMs 的多对多多语言翻译能力,并重点关注零-shot 翻译方向。我们证明,微调期间采用的提示策略对零-shot 翻译至关重要,并引入了一种跨语言一致性正则化方法 XConST,以弥合不同语言之间的表示差距并提高零-shot 翻译性能。XConST 并非一种新方法,而是 CrossConST(Gao et al., 2023a)的一个版本,专门针对 LLMs 的翻译指令微调进行了适配。在 ALMA(Xu et al., 2023)、Tower(Team, 2024)和 LLaMA-2(Touvron et al., 2023)上的实验结果表明,我们的方法持续提升了翻译性能。我们的实现代码可在 https://github.com/gpengzhi/CrossConST-LLM 获取。
引用
@article{arxiv.2401.05861,
title = {Towards Boosting Many-to-Many Multilingual Machine Translation with Large Language Models},
author = {Pengzhi Gao and Zhongjun He and Hua Wu and Haifeng Wang},
journal= {arXiv preprint arXiv:2401.05861},
year = {2024}
}