用于深度神经网络的变分随机梯度下降
机器学习
2025-04-21 v2 机器学习
摘要
当前 SOTA 优化器是诸如 Adam 之类的自适应基于梯度的优化方法。近期,人们对在概率框架内构建基于梯度的优化器以更好地建模梯度不确定性产生了越来越浓厚的兴趣。在此,我们提出将两种方法结合起来,得到变分随机梯度下降(VSGD)优化器。我们将梯度更新建模为概率模型,并利用随机变分推断(SVI)推导出高效且有效的更新规则。此外,我们展示了我们的 VSGD 方法与其他自适应基于梯度的优化器(如 Adam)之间的关系。最后,我们在两个图像分类数据集和四种深度神经网络架构上进行了实验,表明 VSGD 优于 Adam 和 SGD。
引用
@article{arxiv.2404.06549,
title = {Variational Stochastic Gradient Descent for Deep Neural Networks},
author = {Haotian Chen and Anna Kuzina and Babak Esmaeili and Jakub M Tomczak},
journal= {arXiv preprint arXiv:2404.06549},
year = {2025}
}