微调大语言模型进行翻译:少量噪声数据是否足够?
计算与语言
2024-10-07 v2
摘要
传统上,多语言机器翻译的成功可归因于训练数据的三个关键因素:大规模、多样的翻译方向和高质量。在当前微调大语言模型(LLMs)进行翻译的实践中,我们重新审视了这些因素的重要性。我们发现,LLMs在仅用32个平行句对进行微调后便展现出强大的翻译能力,并且仅在一个方向上微调就能实现多方向翻译。然而,方向的选择至关重要:仅用英语作为目标语言进行微调可能导致任务误解,从而阻碍翻译成其他语言。当噪声合成数据位于目标语言侧时,也会出现问题,尤其是当目标语言在LLM预训练中已充分体现时。有趣的是,对于预训练中代表性不足的语言,合成数据的影响则不那么显著。我们的研究结果表明,在将LLM适配到翻译任务时,对数据量的要求可以放宽,但仍需谨慎考虑,以防止LLM利用数据中的非预期偏差。
引用
@article{arxiv.2404.14122,
title = {Fine-Tuning Large Language Models to Translate: Will a Touch of Noisy Data in Misaligned Languages Suffice?},
author = {Dawei Zhu and Pinzhen Chen and Miaoran Zhang and Barry Haddow and Xiaoyu Shen and Dietrich Klakow},
journal= {arXiv preprint arXiv:2404.14122},
year = {2024}
}
备注
EMNLP 2024 Main