重新思考 LoRA 精调的秩阈值
机器学习
2026-05-06 v1 人工智能
摘要
最近的一项 LoRA 精调在神经 tangent kernel 范式下的 landscape 分析确立了一个充分条件 用于 LoRA 秩 在均方误差损失下不存在虚局部极小值,将 作为 canonical few-shot RoBERTa setups 的预期值。该条件针对一般输出维度 表述,因此其在特定范式下的锋利度,以及在实际用于精调的交叉熵损失中的实际含义,仍是开放问题。我们给出三个结果,总体上将预期秩降低到 binary classification 在此范式下的 。首先,用非对称 LoRA 流形维度取代对称 Sard 形式计数,yields 更弱的容量要求,,其中 在高斯-iid 特征下,以 满足 canonical setups。其次,在交叉熵设置下,Polyak-\L{}ojasiewicz 不等式完全消除了秩阈值。第三,一个 Rademacher-complexity 界限预测在 bias 项被饱和时 rank-one variance 最优,这种情况在 binary classification 中成立,但在 时不成立。经验上,在四个 GLUE-style binary 任务、三个 encoder architecture 以及在 RoBERTa-large 上的规模化设置中,秩一与现有预期值 竞争甚至优于;在多类 MNLI 上,最优秩偏移至大于一,也正如预测的那样。binary-regime 保证以标准 NTK 假设为前提;多类推广留给未来工作。
引用
@article{arxiv.2605.03724,
title = {Rethinking the Rank Threshold for LoRA Fine-Tuning},
author = {Juneyoung Park},
journal= {arXiv preprint arXiv:2605.03724},
year = {2026}
}