自动梯度下降:无超参数的深度学习
机器学习
2023-04-12 v1 人工智能
数值分析
神经与进化计算
数值分析
机器学习
摘要
深度神经网络的架构由层数、每层宽度和总体网络拓扑显式定义。现有优化框架忽视这一信息,转而依赖隐式架构信息(如二阶方法)或与架构无关的距离函数(如镜像下降)。同时,实践中最流行的优化器 Adam 基于启发式方法。本文构建了一个推导显式利用神经架构的优化算法的新框架。该理论将镜像下降推广到非凸复合目标函数:其思想是对 Bregman 散度进行变换以考虑神经架构的非线性结构。对深度全连接网络详细推导得到自动梯度下降:一种无任何超参数的一阶优化器。自动梯度下降开箱即用地训练全连接和卷积网络,且可达到 ImageNet 规模。PyTorch 实现见 https://github.com/jxbz/agd 以及附录 B。总体而言,本文为下一代自动工作且无超参数的架构相关优化器提供了严格的理论基础。
引用
@article{arxiv.2304.05187,
title = {Automatic Gradient Descent: Deep Learning without Hyperparameters},
author = {Jeremy Bernstein and Chris Mingard and Kevin Huang and Navid Azizan and Yisong Yue},
journal= {arXiv preprint arXiv:2304.05187},
year = {2023}
}