BLoB:基于反向传播的 LLM 贝叶斯低秩适配
机器学习
2025-01-28 v5 人工智能
计算与语言
机器学习
摘要
大型语言模型(LLM)在推理时常常会出现信心过度的情况,尤其是在针对数据有限的下游领域特定任务进行适配时。以往的工作通过在 LLM 训练后采用近似贝叶斯估计来解决此问题,从而使其能够量化不确定性。然而,这类后训练方法的性能严重受限于训练期间学习到的参数。在本文中,我们超越了后训练的贝叶斯化,提出了一种通过反向传播实现的贝叶斯低秩适配方法(BLoB),该方法在整个微调过程中持续且联合调整 LLM 参数的均值和协方差。我们的实证结果验证了 BLoB 在泛化性和不确定性估计方面的有效性,在评估=in分布数据和 out-of-distribution 数据时均表现良好。
引用
@article{arxiv.2406.11675,
title = {BLoB: Bayesian Low-Rank Adaptation by Backpropagation for Large Language Models},
author = {Yibin Wang and Haizhou Shi and Ligong Han and Dimitris Metaxas and Hao Wang},
journal= {arXiv preprint arXiv:2406.11675},
year = {2025}
}
备注
Accepted at NeurIPS 2024. Additional experiments have been included in the appendix