高效寻找平坦极小值以提升大语言模型微调及更广场景的泛化性能
计算与语言
2025-12-16 v3
摘要
关于低秩适配(LoRA)表达能力与泛化能力之间关联的研究仍较为有限。锐度感知最小化(SAM)通过鼓励收敛到局部平坦极小值,提升了卷积神经网络(CNN)和 Transformer 模型的泛化性能。然而,由于缺乏在经验上寻找平坦极小值的工具或理论方法,锐度与泛化之间的联系在 LoRA 中尚未被充分探索。本工作中,我们提出了平坦极小值 LoRA(FMLoRA)及其高效版本 EFMLoRA,以在 LoRA 中寻找平坦极小值。具体而言,我们从理论上证明,全参数空间中的扰动可被传递到低秩子空间。该方法消除了低秩子空间中跨多个矩阵的扰动可能引入的干扰。我们在大语言模型和视觉-语言模型上开展的大量实验表明,EFMLoRA 在优化效率上与 LoRA 相当,同时取得了与之相当乃至更优的性能。例如,在使用 RoBERTa-large 的 GLUE 数据集上,EFMLoRA 平均分别比 LoRA 和全参数微调高出 1.0 和 0.5;在视觉-语言模型(如 Qwen-VL-Chat)上,在 SQA 和 VizWiz 数据集上分别取得了 1.5 和 1.0 的性能提升。这些经验结果也验证了 LoRA 的泛化性能与锐度密切相关,而这一点被以往方法所忽略。
引用
@article{arxiv.2508.00522,
title = {Efficiently Seeking Flat Minima for Better Generalization in Fine-Tuning Large Language Models and Beyond},
author = {Jiaxin Deng and Qingcheng Zhu and Junbiao Pang and Linlin Yang and Zhongqian Fu and Baochang Zhang},
journal= {arXiv preprint arXiv:2508.00522},
year = {2025}
}