AdaPaD:用于PEFT的自纠正秩发现的自适应并行减尼
机器学习
2026-05-12 v1
摘要
使用LoRA对大型语言模型进行微调需要在训练开始前选择秩r。现有方法要么依次提取秩-1分量,将每个分量的误差永久性地冻结到后续每个残差中,要么联合优化完整的低秩分解,但仅保证描述联合更新的条件,而不描述单个秩-1方向。我们提出了AdaPaD(Adaptive Parallel Deflation),该方法同时训练所有秩-1分量:每个worker针对由所有前任最新估计值构建的减尼目标来细化其分量,随着这些估计改进,目标也随之改进。我们将这种属性称为自纠正:减尼误差在轮次中收敛到零,而不是以固定残差的形式持久存在。在这一骨架之上,AdaPaD添加了advance learning(训练前的私有预训练)和每个模块的动态秩发现(基于重要性的增长,直到耗尽共享预算),将秩分布作为输出而非输入。我们证明了在热身期后,每个分量的误差以指数衰减形式消失, generalization bound 将分解为一个消失的算法项和一个不可消除的统计底。经验上,AdaPaD在DeBERTaV3-base上以匹配参数预算的自适应秩LoRA基线方面具有竞争力,在Qwen3-0.6B的Qwen3-0.6B SQuAD/SQuAD v2上与固定秩LoRA相当,同时部署的适配器平均小30.7%。
引用
@article{arxiv.2605.10741,
title = {AdaPaD: Adaptive Parallel Deflation for PEFT with Self-Correcting Rank Discovery},
author = {Barbara Su and Fangshuo Liao and Anastasios Kyrillidis},
journal= {arXiv preprint arXiv:2605.10741},
year = {2026}
}