面向大型语言模型的动态 LoRA 精调适应
计算与语言
2025-01-28 v1 机器学习
摘要
本文提出一种大型语言模型的新型微调方法——动态 LoRA。该方法基于标准的低秩适应 (LoRA) 框架,进一步添加动态适应机制以提高效率和性能。动态 LoRA 的关键贡献在于其自适应权重分配机制 coupled with 基于输入特征的自适应策略。这些增强措施允许更精确地针对特定任务进行微调。传统 LoRA 方法使用静态适配器设置,不考虑模型各层的不同重要性。相比之下,动态 LoRA 引入一种在微调期间动态评估各层重要性的机制。这种评估使我们能够根据每个 individual task 的独特需求重新分配适配器参数,从而获得更好的优化结果。另一项灵活性提升来自对输入特征分布的考虑,这有助于模型在面对复杂且多样化的数据集时更好地泛化。这种联合方法不仅提升了每个单一 task 的性能,也增强了模型的泛化能力。在 GLUE 等基准数据集上的实验验证了动态 LoRA 的效率,取得令人惊讶的效果。具体而言,该方法以 88.1% 的准确率和 87.3% 的 F1 分数取得好结果。值得注意的是,这些改进仅增加 0.1% 的计算资源,相较于标准 LoRA。这种性能与效率之间的平衡将动态 LoRA 定位为大型语言模型微调的实用且可扩展解决方案,尤其适用于资源受限的场景。进一步地,其适应性使其成为更高级应用的有前景的基础,包括多模态任务。
引用
@article{arxiv.2501.14859,
title = {Dynamic Adaptation of LoRA Fine-Tuning for Efficient and Task-Specific Optimization of Large Language Models},
author = {Xiaoxuan Liao and Chihang Wang and Shicheng Zhou and Jiacheng Hu and Hongye Zheng and Jia Gao},
journal= {arXiv preprint arXiv:2501.14859},
year = {2025}
}