中文

用于训练二值与脉冲神经网络的原则性贝叶斯框架

机器学习 2025-05-26 v1

摘要

我们提出了一种用于训练二值与脉冲神经网络的贝叶斯框架,在不使用归一化层的情况下达到了最先进的性能。与常用的替代梯度方法(通常基于启发式且对超参数选择敏感)不同,我们的方法基于噪声二值网络的概率模型,能够实现完全端到端的基于梯度的优化。我们引入了重要性加权直通(IW-ST)估计器,这是一个统一类别,概括了直通和基于松弛的估计器。我们刻画了这一族估计器中的偏差-方差权衡,并推导出一个通过辅助损失实现的最小化偏差目标。在此基础上,我们引入了脉冲贝叶斯神经网络(SBNNs),一种变分推断框架,利用后验噪声来训练使用 IW-ST 的二值和脉冲神经网络。这种贝叶斯方法最小化了梯度偏差、正则化了参数,并引入了类似 dropout 的噪声。通过将低偏差条件、梯度消失与 KL 项联系起来,我们实现了无需归一化的深度残差网络训练。在 CIFAR-10、DVS Gesture 和 SHD 上的实验表明,我们的方法在不使用归一化或手工调参梯度的情况下,匹配或超越了现有方法。

关键词

引用

@article{arxiv.2505.17962,
  title  = {A Principled Bayesian Framework for Training Binary and Spiking Neural Networks},
  author = {James A. Walker and Moein Khajehnejad and Adeel Razi},
  journal= {arXiv preprint arXiv:2505.17962},
  year   = {2025}
}