中文

使用Metropolis蒙特卡洛及一种自适应变体训练神经网络

机器学习 2022-08-11 v2 统计力学 神经与进化计算

摘要

我们考察零温Metropolis蒙特卡洛算法作为一种通过最小化损失函数来训练神经网络的工具。我们发现,正如理论预期以及其他作者经验所展示的,Metropolis蒙特卡洛能够以与梯度下降相当(虽不一定同样快速)的精度训练神经网络。当神经网络的参数数量很大时,Metropolis算法并不会自动失效。但当神经网络的结构或神经元激活高度异质时,它可能失效;为此我们引入一种自适应蒙特卡洛算法aMC,以克服这些局限。蒙特卡洛方法固有的随机性与数值稳定性使得aMC能够训练深度神经网络与循环神经网络,而在这类网络中梯度过小或过大以至于无法用梯度下降进行训练。蒙特卡洛方法为基于梯度的神经网络训练方法提供了补充,使得能够触及一组不同的网络架构与原理。

关键词

引用

@article{arxiv.2205.07408,
  title  = {Training neural networks using Metropolis Monte Carlo and an adaptive variant},
  author = {Stephen Whitelam and Viktor Selin and Ian Benlolo and Corneel Casert and Isaac Tamblyn},
  journal= {arXiv preprint arXiv:2205.07408},
  year   = {2022}
}