中文

使用尺度不变架构对神经网络进行鲁棒训练

机器学习 2022-07-20 v2 机器学习

摘要

与SGD相比,像Adam这样的自适应梯度方法允许对现代深度网络(尤其是大语言模型)进行鲁棒训练。然而,自适应性的使用不仅以额外内存为代价,还提出了一个基本问题:像SGD这样的非自适应方法能否享有类似的好处?在本文中,我们通过提出以下通用方案来对这一问题的给出肯定回答,以实现鲁棒且内存高效的训练:(1) 修改架构并使其尺度不变,即参数的尺度不影响网络的输出,(2) 使用SGD和权重衰减进行训练,以及可选地 (3) 将全局梯度范数裁剪为与权重范数乘以 2λη\sqrt{\tfrac{2\lambda}{\eta}} 成正比,其中 η\eta 是学习率,λ\lambda 是权重衰减。我们证明这种通用方法对参数和损失的重标度具有鲁棒性,证明其收敛仅对数依赖于初始化和损失的尺度,而标准SGD对于许多初始化甚至可能不收敛。遵循我们的方案,我们设计了BERT的尺度不变版本,称为SIBERT,当仅使用 vanilla SGD训练时,其在下游任务上取得了与通过Adam等自适应方法训练的BERT相当的性能。

关键词

引用

@article{arxiv.2202.00980,
  title  = {Robust Training of Neural Networks Using Scale Invariant Architectures},
  author = {Zhiyuan Li and Srinadh Bhojanapalli and Manzil Zaheer and Sashank J. Reddi and Sanjiv Kumar},
  journal= {arXiv preprint arXiv:2202.00980},
  year   = {2022}
}

备注

36 pages, 7 figures; ICML 2022