微调悖论:提升翻译质量而不牺牲大语言模型能力
计算与语言
2024-08-07 v2
摘要
针对机器翻译微调大语言模型(LLMs)已显示出整体翻译质量的提升。然而,微调对LLMs中神经机器翻译模型所不具备的理想行为(如可引导性、固有的文档级翻译能力以及生成非字面翻译的能力)有何影响尚不清楚。我们对LLaMA和Falcon系列模型(参数量从70亿到650亿)进行了广泛的翻译评估。结果表明,虽然微调提高了LLMs的一般翻译质量,但若干能力有所下降。具体而言,我们观察到在形式性引导、通过少样本示例生成技术翻译以及文档级翻译方面的能力下降。另一方面,我们观察到模型在平行数据上微调后产生了更少字面化的翻译。我们证明,通过将单语数据纳入微调数据,可以在保持这些能力的同时提升整体翻译质量。我们的发现强调了需要制定能够保留LLMs在机器翻译中优势的微调策略。
引用
@article{arxiv.2405.20089,
title = {The Fine-Tuning Paradox: Boosting Translation Quality Without Sacrificing LLM Abilities},
author = {David Stap and Eva Hasler and Bill Byrne and Christof Monz and Ke Tran},
journal= {arXiv preprint arXiv:2405.20089},
year = {2024}
}
备注
Accepted to ACL 2024 (long, main). Latest version includes link to the IdiomsInCtx-MT dataset