中文

贝叶斯低秩学习(Bella):一种实用的贝叶斯神经网络方法

机器学习 2025-02-19 v5 人工智能 计算机视觉与模式识别

摘要

贝叶斯学习的计算复杂性阻碍了其在实际大规模任务中的应用。尽管贝叶斯方法已被证明具有显著优势,例如对未见输入或分布外输入具有更好的鲁棒性和韧性,但其实际应用已几乎被忽视。在本研究中,我们引入了一种创新框架,以减轻贝叶斯神经网络(BNN)的计算负担。我们的方法遵循基于深度集成的贝叶斯技术原理,但通过基于预训练神经网络的多个低秩参数扰动,显著降低了其成本。无论是朴素的集成版本,还是更复杂的方案(如使用斯坦变分梯度下降(SVGD)的贝叶斯学习,此前被认为不适用于大型模型),都可以无缝集成到所提出的框架中,该框架被称为贝叶斯低秩学习(Bella)。简而言之,i) Bella大幅减少了近似贝叶斯后验所需的可训练参数数量;ii) 它不仅保持了,在某些情况下甚至超越了传统贝叶斯学习方法和非贝叶斯基线的性能。我们在ImageNet、CAMELYON17、DomainNet、VQA(使用CLIP)和LLaVA等大规模任务上的结果,证明了Bella在构建用于实际应用的高可扩展性、实用性贝叶斯深度模型方面的多功能性和有效性。

关键词

引用

@article{arxiv.2407.20891,
  title  = {Bayesian Low-Rank LeArning (Bella): A Practical Approach to Bayesian Neural Networks},
  author = {Bao Gia Doan and Afshar Shamsi and Xiao-Yu Guo and Arash Mohammadi and Hamid Alinejad-Rokny and Dino Sejdinovic and Damien Teney and Damith C. Ranasinghe and Ehsan Abbasnejad},
  journal= {arXiv preprint arXiv:2407.20891},
  year   = {2025}
}

备注

This paper is accepted in AAAI'25", and the code is available at https://bnn-bella.github.io/BNN-Bella/