GRIT — 基于 K-FAC 预条件、Fisher 导向重投影和动态秩适应的几何感知 PEFT
机器学习
2026-01-05 v1 人工智能
摘要
参数高效微调 (PEFT) 已成为调整大型语言模型 (LLM) 的默认方式,但广泛使用的 LoRA 和 QLoRA 在很大程度上是几何不可感知的:它们在固定、随机取向的低秩子空间中优化,采用一阶梯度下降,基本忽略局部损失曲率。这可能会膨胀有效更新预算,并放大沿弱约束方向的漂移。我们引入 GRIT,一种动态、受曲率启发的 LoRA 程序,保留 LoRA 参数化,同时:(1) 使用 K-FAC 作为自然梯度代理对梯度在秩空间进行预条件化;(2) 定期将低秩基准准射向主导 Fisher 特征方向以抑制漂移;(3) 根据谱系动态适应有效秩,以将容量集中于信号所在处。在 LLaMA 基础模型上针对指令跟随、理解和推理基准测试中,GRIT 在保持 LoRA 和 QLoRA性能的同时,通过平均减少 46% 可训练参数 (跨任务 25-80%),且在各种提示风格和数据混合方案下无显著质量损失。为建模遗忘,我们拟合曲率调制幂律。经验上,GRIT 比强大的 PEFT 优化器基线 (Orthogonal-LoRA、IA3、DoRA、Eff-FT、Shampoo) 具有更低的漂移及更佳的更新与保留前沿。
引用
@article{arxiv.2601.00231,
title = {GRIT -- Geometry-Aware PEFT with K-FACPreconditioning, Fisher-Guided Reprojection, andDynamic Rank Adaptation},
author = {Pritish Saha and Chandrav Rajbangshi and Rudra Goyal and Mohit Goyal and Anurag Deo and Biswajit Roy and Ningthoujam Dhanachandra Singh and Raxit Goswami and Amitava Das},
journal= {arXiv preprint arXiv:2601.00231},
year = {2026}
}