平衡与非平衡中的机器学习
机器学习
2023-06-07 v1 统计力学
摘要
用于训练神经网络的算法,如随机梯度下降(SGD),与自然过程中在高维参数空间中导航有着密切的相似之处——例如蛋白质折叠或进化。我们的研究使用改编自统计物理的 Fokker-Planck 方法来在单一统一框架中探索这些相似之处。我们特别关注系统在长时间极限下的稳态,在常规 SGD 中它是非平衡的,在网络参数空间中表现出持续电流。正如在其物理类似物中一样,该电流与任何给定训练轨迹的熵产生率相关联。这些速率的稳态分布服从积分和细致涨落定理——热力学第二定律的非平衡推广。我们在两个数值例子中验证了这些关系,一个非线性回归网络和一个 MNIST 数字分类。虽然涨落定理是普适的,但稳态的其他方面对训练细节高度敏感。令人惊讶的是,决定稳态分布形状的有效损失景观和扩散矩阵会根据是否采用有放回或无放回的简单 minibatching 选择而变化。我们可以利用这种非平衡敏感性来为特定应用设计平衡稳态:在贝叶斯机器学习中从网络权重的后验分布中采样。我们提出了随机梯度 Langevin 动力学(SGLD)的一种新变体,它利用无放回 minibatching。在一个后验精确已知的示例系统中,该 SGWORLD 算法优于 SGLD,作为学习率的函数,它收敛到后验的速度快了几个数量级。
引用
@article{arxiv.2306.03521,
title = {Machine learning in and out of equilibrium},
author = {Shishir Adhikari and Alkan Kabakçıoğlu and Alexander Strang and Deniz Yuret and Michael Hinczewski},
journal= {arXiv preprint arXiv:2306.03521},
year = {2023}
}
备注
24 pages, 6 figures