使用Metropolis蒙特卡洛及一种自适应变体训练神经网络
机器学习
2022-08-11 v2 统计力学
神经与进化计算
摘要
我们考察零温Metropolis蒙特卡洛算法作为一种通过最小化损失函数来训练神经网络的工具。我们发现,正如理论预期以及其他作者经验所展示的,Metropolis蒙特卡洛能够以与梯度下降相当(虽不一定同样快速)的精度训练神经网络。当神经网络的参数数量很大时,Metropolis算法并不会自动失效。但当神经网络的结构或神经元激活高度异质时,它可能失效;为此我们引入一种自适应蒙特卡洛算法aMC,以克服这些局限。蒙特卡洛方法固有的随机性与数值稳定性使得aMC能够训练深度神经网络与循环神经网络,而在这类网络中梯度过小或过大以至于无法用梯度下降进行训练。蒙特卡洛方法为基于梯度的神经网络训练方法提供了补充,使得能够触及一组不同的网络架构与原理。
引用
@article{arxiv.2205.07408,
title = {Training neural networks using Metropolis Monte Carlo and an adaptive variant},
author = {Stephen Whitelam and Viktor Selin and Ian Benlolo and Corneel Casert and Isaac Tamblyn},
journal= {arXiv preprint arXiv:2205.07408},
year = {2022}
}