在多个数据集上微调语言模型的高效集成方法
机器学习
2025-05-29 v1 计算与语言
摘要
本文开发了一种在多个数据集上微调语言模型的集成方法。现有方法(如量化 LoRA(QLoRA))在适应单个数据集时是高效的。当在不同任务的多个数据集上进行训练时(这是实践中的常见设置),如何设计高效的适应方法来微调语言模型仍不明确。我们建议使用多个较小适配器的集成,而不是每个任务使用单个适配器。我们设计了一种高效算法,将 个数据集划分为 个组(在实践中 通常远小于 ),并为每个组训练一个适配器,然后取加权组合形成集成。该算法利用低秩适应的一阶近似特性来快速获取数据集组合的微调性能,因为像 LoRA 这样的方法会保持接近基础模型。因此,我们使用基础模型的梯度来估计其在微调期间的行为。从经验上看,这种近似在参数量高达 340 亿的模型上误差小于 ,从而在低于 的误差下估计真实的微调性能,同时与基础微调相比将计算速度提高 105 倍。在十个文本分类任务上微调 Llama 和 GPT 模型时,我们的方法比 QLoRA 的平均测试准确率最高高出 ,且仅增加 的 FLOPs。在具有 340 亿参数的 Llama 模型上,QLoRA 的集成与 QLoRA 相比将测试准确率提高了 ,且仅增加 的 FLOPs。
引用
@article{arxiv.2505.21930,
title = {Efficient Ensemble for Fine-tuning Language Models on Multiple Datasets},
author = {Dongyue Li and Ziniu Zhang and Lu Wang and Hongyang R. Zhang},
journal= {arXiv preprint arXiv:2505.21930},
year = {2025}
}
备注
17 pages. To appear in ACL'25