贝叶斯-LoRA:大型语言模型的概率低秩适配
人工智能
2026-04-16 v2
摘要
大型语言模型通常更强调准确率,因此即使对预测不够确定也会作出猜测,这在小数据集上微调时尤为严重,due to 内在的误校准倾向。在本工作中,我们引入 Bayesian-LoRA,将确定性 LoRA 更新重新表述为受稀疏高斯过程启发的概率低秩表示。我们识别到 LoRA 的因式分解与 Kronecker-分解 SGP 后验之间的结构同构性,表明当后验不确定性收敛时,LoRA 作为极限情形。我们在各种 LLM 架构上进行了大量实验,涵盖常识推理基准。在仅增加约 0.42M 参数且训练成本仅为标准 LoRA 的约 1.2 倍的情况下,Bayesian-LoRA 在最高达 30B 参数的模型上显著改善了校准效果,在双向(in-distribution)和离网(out-of-distribution, OoD)评估中保持竞争的准确率。
引用
@article{arxiv.2601.21003,
title = {Bayesian-LoRA: Probabilistic Low-Rank Adaptation of Large Language Models},
author = {Moule Lin and Shuhao Guan and Andrea Patane and David Gregg and Goetz Botterweck},
journal= {arXiv preprint arXiv:2601.21003},
year = {2026}
}