中文

SGD 作为自由能最小化:神经网络训练的热力学视角

机器学习 2025-05-30 v1

摘要

我们提出了神经网络训练中固定学习率(LR)下随机梯度下降(SGD)稳态行为的热力学解释。我们表明,SGD 隐式地最小化自由能函数 F=UTSF=U-TS,平衡训练损失 UU 和权重分布的熵 SS,其中温度 TT 由 LR 决定。这一视角为理解高 LR 为何阻止训练收敛至损失极小值,以及不同 LR 如何导致在不同损失水平下稳定,提供了新视角。我们在欠参数化(UP)和过参数化(OP)模型上实证验证了该自由能框架。UP 模型始终遵循自由能最小化,温度随 LR 单调增加;而对于 OP 模型,在低 LR 下温度有效降至零,导致 SGD 直接最小化损失并收敛至最优解。我们将这种不匹配归因于最优解附近随机梯度信噪比的差异,并通过一个简单示例和神经网络实验予以支持。

关键词

引用

@article{arxiv.2505.23489,
  title  = {SGD as Free Energy Minimization: A Thermodynamic View on Neural Network Training},
  author = {Ildus Sadrtdinov and Ivan Klimov and Ekaterina Lobacheva and Dmitry Vetrov},
  journal= {arXiv preprint arXiv:2505.23489},
  year   = {2025}
}

备注

First two authors contributed equally