梯度下降、随机优化及其他故事
机器学习
2024-01-15 v2 神经与进化计算
最优化与控制
摘要
本文的目标是揭穿并驱散黑盒优化器与随机优化器背后的神秘性。它旨在就这些技术如何及为何有效建立坚实基础。本手稿从简单直觉出发推导策略背后的数学,从而 crystallize 这一知识。本教程不回避讨论梯度下降与随机优化方法的正式与非正式两方面。借此,它希望为读者提供对这些技术更深的理解,以及应用这些算法的何时、如何与为何。梯度下降是执行优化最流行的算法之一,且迄今是优化机器学习任务最常用的方法。其随机版本近年受到关注,在优化深度神经网络时尤为如此。在深度神经网络中,跟随单个样本或一批样本的梯度被用来节省计算资源并逃离鞍点。1951年,Robbins 与 Monro 发表了 \textit{A stochastic approximation method},这是关于用新批次样本估计局部梯度的随机优化早期现代论述之一。而现在,随机优化已成为机器学习的核心技术,很大程度上得益于拟合神经网络中反向传播算法的发展。本文的唯一目标是给出梯度下降与随机优化中概念与数学工具的自包含介绍。
引用
@article{arxiv.2205.00832,
title = {Gradient Descent, Stochastic Optimization, and Other Tales},
author = {Jun Lu},
journal= {arXiv preprint arXiv:2205.00832},
year = {2024}
}