FIM-LoRA:基于校准时梯度方差估计的LoRA任务信息性秩分配
机器学习
2026-05-19 v1 计算与语言
摘要
低秩适应(LoRA)为每个被适应的权重矩阵分配统一的秩——这是一种实用便利,忽略了一种根本事实:不同层对任务适应的贡献不相等。我们通过一种轻量级工程解决方案来解决这一问题:在微调开始之前运行八次校准反向传播,计算每个LoRA-B矩阵的梯度方差作为层信息性比例,并按比例重新分配秩预算。 resulting adapter 是标准的LoRA,具有每个层的秩模式——无需新增参数、无训练开销、无需更改serving基础设施。我们通过对仅限于LoRA适配器矩阵的eFIM对角线的有效近似来实现这一点,这将相对于完整模型Fisher估计的内存成本降低约256倍。在GLUE数据集上使用DeBERTa-v3-base,FIM-LoRA在相同参数预算下与LoRA相当(88.6 vs. 88.7);在常识推理任务中使用LLaMA-3-8B,达到68.5 vs. 68.7。每个层的秩图具有可解释性:值投影和早期到中层 consistently 收到更高的秩,这与对transformer层作用的既有发现相符。
关键词
引用
@article{arxiv.2605.16800,
title = {FIM-LoRA: Task-Informative Rank Allocation for LoRA via Calibration-Time Gradient-Variance Estimation},
author = {Ramakrishnan Sathyavageeswaran},
journal= {arXiv preprint arXiv:2605.16800},
year = {2026}
}
备注
10 pages, 1 figure