Ladder: 一种提升基于LLM的机器翻译性能的模型无关框架
计算与语言
2024-10-30 v3 人工智能
机器学习
摘要
通用大型语言模型(LLM),如GPT-4,通过利用广泛的网络内容,在机器翻译(MT)方面取得了显著进展。另一方面,特定于翻译的LLM是通过在特定领域的单语语料库上进行预训练,并使用人工标注的翻译数据进行微调而构建的。尽管性能优越,但这些方法要么需要前所未有的计算和数据规模,要么需要大量的人工编辑和标注工作。在本文中,我们开发了MT-Ladder,一种新颖的、模型无关且经济高效的工具,用于改进通用LLM在MT上的性能。MT-Ladder在伪精炼三元组上进行训练,这些三元组可以轻松地从现有LLM中获得,无需额外的人工成本。在训练过程中,我们提出了一种分层微调策略,采用从易到难的方案,逐步提高MT-Ladder的精炼性能。训练好的MT-Ladder可以无缝集成到任何通用LLM中,以提升其翻译性能。通过使用Gemma-2B/7B作为骨干网络,MT-Ladder-2B可以将原始翻译提升到顶级开源模型的水平(例如,将BigTranslate-13B在XX-En方向上的BLEU值提升+6.91,COMET值提升+3.52),而MT-Ladder-7B可以进一步提升模型性能,使其与最先进的GPT-4相媲美。大量的消融实验和分析证实了MT-Ladder在不同设置下的有效性。我们的代码可在https://github.com/fzp0424/MT-Ladder获取。
引用
@article{arxiv.2406.15741,
title = {Ladder: A Model-Agnostic Framework Boosting LLM-based Machine Translation to the Next Level},
author = {Zhaopeng Feng and Ruizhe Chen and Yan Zhang and Zijie Meng and Zuozhu Liu},
journal= {arXiv preprint arXiv:2406.15741},
year = {2024}
}
备注
EMNLP 2024 Main. Data and code are available at https://github.com/fzp0424/MT-Ladder