一种用于微调大语言模型的多编码器冻结解码器方法
计算与语言
2025-01-15 v1 人工智能
机器学习
摘要
在参数高效微调方法中,冻结已成为一种流行的策略,用于加速训练、减少灾难性遗忘并提升下游性能。我们在包含多种自然语言任务的多任务设置中研究了解码器冻结的影响,旨在减少部署开销并增强对新任务的可移植性。我们在AlexaTM模型上通过微调单任务和多任务设置进行的实验表明,冻结解码器对于具有自然语言输出的任务非常有效,并能减轻多语言任务中的灾难性遗忘。然而,我们发现将冻结解码器与更大的模型配对,可以有效地维持甚至在结构化和QA任务中提升性能,使其成为适用于更广泛任务类型的可行策略。
引用
@article{arxiv.2501.07818,
title = {A Multi-Encoder Frozen-Decoder Approach for Fine-Tuning Large Language Models},
author = {Kaustubh D. Dhole},
journal= {arXiv preprint arXiv:2501.07818},
year = {2025}
}