中文

类随机梯度下降松弛在离散优化与推断问题中等价于Metropolis动力学

无序系统与神经网络 2024-05-31 v2 统计力学 机器学习

摘要

随机梯度下降(SGD)与Metropolis蒙特卡洛动力学是否有本质区别?在理解机器学习领域最常用的训练算法之时,这是一个根本性问题,但至今未获解答。本文表明,在离散优化与推断问题中,一种类SGD算法的动力学与选取了恰当温度(该温度依赖于小批量大小)的Metropolis蒙特卡洛动力学极为相似。尽管两种算法存在根本性差异(例如SGD不满足细致平衡),这一定量匹配在平衡态与非平衡态下均成立。这种等价性使我们能够利用关于蒙特卡洛算法性能与局限的既有结论,来优化类SGD算法中的小批量大小,并使其在困难推断问题中高效地恢复信号。

关键词

引用

@article{arxiv.2309.05337,
  title  = {Stochastic Gradient Descent-like relaxation is equivalent to Metropolis dynamics in discrete optimization and inference problems},
  author = {Maria Chiara Angelini and Angelo Giorgio Cavaliere and Raffaele Marino and Federico Ricci-Tersenghi},
  journal= {arXiv preprint arXiv:2309.05337},
  year   = {2024}
}

备注

19 pages, 9 figures