FuRA:基于谱预条件的全秩参数高效微调
机器学习
2026-05-25 v1
摘要
全微调 (Full FT) 以及参数高效微调方法如 LoRA 均未考虑预训练期间确立的谱结构,导致来自有限微调数据的噪声梯度会扰动稳健的预训练特征。我们识别出谱预条件这一缺失因素:通过对每个权重矩阵进行全秩奇异值分解 (SVD) 并冻结一个奇异基,约束更新停留在预训练的列空间中,从而实现优于无约束 Full FT 的预条件化优化方案。基于这一洞见,我们提出 FuRA (Full-Rank Adaptation),一种基于块张量-列车 factorization 的高效全秩适应框架:,其中较大的核心 固定为预训练的块级 SVD 基,仅优化紧凑核心 和块级奇异值 。该设计同时提供全秩谱预条件、保留全秩更新表达性,并在参数、内存和步骤时间效率上与 LoRA 相当。FuRA 在多个设置下均优于 Full FT,包括 LLM 微调(在 LLaMA-3-8B 常识推理上提升 +1.37)、LLM 强化学习用于数学推理,以及视觉指令调优用于 VLM。此外,4 位量化变体 QFuRA 也超越 QLoRA。代码已公开于 https://github.com/olokevin/FuRA-NIPS。
引用
@article{arxiv.2605.22869,
title = {FuRA: Full-Rank Parameter-Efficient Fine-Tuning with Spectral Preconditioning},
author = {Yequan Zhao and Ruijie Zhang and Liyan Tan and Niall Moran and Tong Qin and Zheng Zhang},
journal= {arXiv preprint arXiv:2605.22869},
year = {2026}
}