中文

在次二次时间内训练多层过参数化神经网络

机器学习 2023-11-27 v2 数据结构与算法

摘要

我们考虑训练多层过参数化神经网络以最小化由损失函数诱导的经验风险的问题。在典型的过参数化设定中,网络宽度 mm 远大于数据维度 dd 和训练样本数 nnm=poly(n,d)m=\mathrm{poly}(n,d)),这导致每层都有一个 prohibitively 大的权重矩阵 WRm×mW\in \mathbb{R}^{m\times m}。朴素地,人们必须付出 O(m2)O(m^2) 的时间来读取权重矩阵并在前向与反向计算中评估神经网络函数。在这项工作中,我们展示了如何降低每次迭代的训练代价。具体而言,我们提出了一个框架,该框架仅在初始化阶段使用 m2m^2 的代价,并在关于 mm 的意义上实现每次迭代真正次二次的代价,即每次迭代 m2Ω(1)m^{2-\Omega(1)}。我们的结果在标准过参数化理论之外也有意义,因为它可被视为在预训练大模型之上设计高效数据结构以进一步加速微调过程,而这是部署大语言模型(LLM)的核心步骤。

关键词

引用

@article{arxiv.2112.07628,
  title  = {Training Multi-Layer Over-Parametrized Neural Network in Subquadratic Time},
  author = {Zhao Song and Lichen Zhang and Ruizhe Zhang},
  journal= {arXiv preprint arXiv:2112.07628},
  year   = {2023}
}

备注

ITCS 2024