中文

基于随机变分子子空间推断的大型语言模型可扩展贝叶斯低秩适应

机器学习 2025-06-27 v1 人工智能 计算与语言

摘要

尽管广泛使用,大型语言模型(LLMs)仍known to 幻听并产生不正确信息,且标定较差。这使得对这些模型进行不确定性量化变得至关重要,尤其是在如自动驾驶和医疗保健等高风险领域。在先前的工作中,通过对细化模型的低秩适应(LoRA)参数进行推断,使基于贝叶斯深度学习的方法更具可行性。尽管效果良好,但这些方法由于需要额外的参数,难以扩展到更大的 LLMs。在本工作中,我们提出了 Scalable Bayesian Low-Rank Adaptation via Stochastic Variational Subspace Inference(ScalaBL)。我们在 LoRA 秩为 r 的 r 维子空间中进行贝叶斯推断。通过将 LoRA 参数用作投影矩阵,我们能够将来自该子空间的样本映射到 LLM 的完整权重空间。这使我们能够使用随机变分推断学习我们方法的所有参数。尽管子空间的维度较低,我们仍能实现与最先进方法相当的性能,只需约 1000 个额外参数。此外,它允许我们扩展到截至目前为止规模最大的贝叶斯 LLM,其基本参数数量是先前工作的四倍。

关键词

引用

@article{arxiv.2506.21408,
  title  = {Scalable Bayesian Low-Rank Adaptation of Large Language Models via Stochastic Variational Subspace Inference},
  author = {Colin Samplawski and Adam D. Cobb and Manoj Acharya and Ramneet Kaur and Susmit Jha},
  journal= {arXiv preprint arXiv:2506.21408},
  year   = {2025}
}

备注

Accepted at UAI 2025