中文

用于采样经minibatch训练的前馈神经网络受控Langevin动力学

无序系统与神经网络 2026-03-17 v1 机器学习

摘要

根据玻尔兹曼分布对人工神经网络的参数空间进行采样,可提供对低损失解几何的见解,并为训练提供传统损失最小化的替代方案。然而,像混合Monte Carlo(hMC)等精确采样方法虽然形式上是正确的,但由于需要重复评估全批梯度,在真实数据集上变得计算上昂贵。我们引入一种伪Langevin(pL)动力学,利用minibatch以受控方式实现经大数据集训练的前馈神经网络的高效玻尔兹曼采样。该方法利用minibatch梯度噪声的统计特性,调整虚构质量和摩擦系数,以确保诱导的随机过程高效地采样所需的平衡分布。我们通过数值比较其平衡统计与精确hMC采样得到的统计来进行验证。性能基准显示,随着网络规模的增加,hMC迅速变得效率低下,而pL方案保持高计算扩散,能够优势地扩展到超过百万参数的网络。最后,我们表明,在中间温度进行采样可获得最佳泛化性能,相当于SGD,而无需验证集或早期停止程序。这些结果确立了受控minibatch Langevin动力学作为探索和利用大型神经网络解空间的实用且可扩展工具。

关键词

引用

@article{arxiv.2603.15367,
  title  = {Controlled Langevin Dynamics for Sampling of Feedforward Neural Networks Trained with Minibatches},
  author = {Alessandro Zambon and Francesca Caruso and Riccardo Zecchina and Guido Tiana},
  journal= {arXiv preprint arXiv:2603.15367},
  year   = {2026}
}