在次线性时间内训练过参数化神经网络
机器学习
2024-02-09 v2 数据结构与算法
机器学习
摘要
深度学习的成功伴随着巨大的计算和能源成本,而训练大规模过参数化神经网络的可扩展性正成为人工智能(AI)发展的真正障碍。尽管基于梯度下降的传统反向传播因其流行性和每次迭代的低廉成本而广受使用,随机梯度下降(SGD)在非凸设定下的收敛速度在理论与实践上均令人难以接受。为缓解此成本,近期工作提出采用具有更快收敛速度的替代性(牛顿型)训练方法,尽管其每次迭代的成本更高。对于一个具有 个参数、输入批次为 中 个数据点的典型神经网络,[Brand, Peng, Song, and Weinstein, ITCS'2021] 的先前工作每次迭代需要 的时间。在本文中,我们提出一种新颖的训练方法,在同一过参数化 regime 下仅需 的摊还时间,其中 为某个固定常数。该方法依赖于一种对神经网络的新颖且替代性的视角,将其视为一组二叉搜索树,其中每次迭代对应于修改树中一小部分节点。我们相信这一视角将在深度神经网络(DNNs)的设计与分析中具有进一步的应用。
引用
@article{arxiv.2208.04508,
title = {Training Overparametrized Neural Networks in Sublinear Time},
author = {Yichuan Deng and Hang Hu and Zhao Song and Omri Weinstein and Danyang Zhuo},
journal= {arXiv preprint arXiv:2208.04508},
year = {2024}
}