SGD 作为自由能最小化:神经网络训练的热力学视角
机器学习
2025-05-30 v1
摘要
我们提出了神经网络训练中固定学习率(LR)下随机梯度下降(SGD)稳态行为的热力学解释。我们表明,SGD 隐式地最小化自由能函数 ,平衡训练损失 和权重分布的熵 ,其中温度 由 LR 决定。这一视角为理解高 LR 为何阻止训练收敛至损失极小值,以及不同 LR 如何导致在不同损失水平下稳定,提供了新视角。我们在欠参数化(UP)和过参数化(OP)模型上实证验证了该自由能框架。UP 模型始终遵循自由能最小化,温度随 LR 单调增加;而对于 OP 模型,在低 LR 下温度有效降至零,导致 SGD 直接最小化损失并收敛至最优解。我们将这种不匹配归因于最优解附近随机梯度信噪比的差异,并通过一个简单示例和神经网络实验予以支持。
引用
@article{arxiv.2505.23489,
title = {SGD as Free Energy Minimization: A Thermodynamic View on Neural Network Training},
author = {Ildus Sadrtdinov and Ivan Klimov and Ekaterina Lobacheva and Dmitry Vetrov},
journal= {arXiv preprint arXiv:2505.23489},
year = {2025}
}
备注
First two authors contributed equally