中文

微调大语言模型用于领域特定机器翻译

计算与语言 2024-12-18 v2 机器学习

摘要

大语言模型(LLM)在领域特定机器翻译(MT)中显示出巨大潜力。然而,一个主要问题是,在通用领域语料库上预训练的LLM可能由于缺乏领域特定知识而无法很好地泛化到特定领域。为了解决这个问题,本文专注于通过提供高质量训练数据集并提出一种新颖的微调框架DragFT来增强LLM的领域特定MT能力。DragFT通过三种技术增强LLM:(i)字典增强提示将字典信息整合到提示中,以改进领域特定术语的翻译;(ii)基于RAG的少样本示例选择提供同时模拟领域和风格特征的高质量示例;(iii)使用领域内示例进行少样本微调进一步提升了性能。我们在三个具有13B训练参数的知名LLM骨干上部署DragFT以验证其有效性。在三个领域特定数据集上的结果表明,DragFT实现了显著的性能提升,并显示出优于GPT-3.5和GPT-4o等先进模型的性能。DragFT相对于现有LLM的显著性能提升可归因于在减轻噪声的同时融入了相关知识。

关键词

引用

@article{arxiv.2402.15061,
  title  = {Fine-tuning Large Language Models for Domain-specific Machine Translation},
  author = {Jiawei Zheng and Hanghai Hong and Feiyan Liu and Xiaoli Wang and Jingsong Su and Yonggui Liang and Shikai Wu},
  journal= {arXiv preprint arXiv:2402.15061},
  year   = {2024}
}

备注

13 pages, 5 figures, 9 tables