中文

能量-熵竞争与随机梯度下降在机器学习中的有效性

机器学习 2018-09-26 v1 统计力学 机器学习

摘要

寻找使损失函数最小化的参数在许多机器学习方法的核心。随机梯度下降(Stochastic Gradient Descent, SGD)算法被广泛使用,并为许多问题提供了最先进的结果。然而,随机梯度下降通常无法找到全局最小值,因此其经验有效性至今成谜。我们推导了参数推断与统计物理中自由能最小化之间的对应关係。欠采样程度起到温度的作用。类似于统计物理中的能量-熵竞争,若系统被欠采样(这在许多应用中很典型),宽而浅的极小点可以是最优的。此外,我们表明算法中的随机性具有非平凡的相关结构,系统性地使其偏向宽极小点。我们用两个原型模型说明我们的论点:使用深度学习的图像分类,以及一个线性神经网络,在其中我们可以解析地揭示熵与样本外误差之间的关係。

关键词

引用

@article{arxiv.1803.01927,
  title  = {Energy-entropy competition and the effectiveness of stochastic gradient descent in machine learning},
  author = {Yao Zhang and Andrew M. Saxe and Madhu S. Advani and Alpha A. Lee},
  journal= {arXiv preprint arXiv:1803.01927},
  year   = {2018}
}