中文

张量程序 V:通过零样本超参数迁移调优大型神经网络

机器学习 2022-03-29 v2 无序系统与神经网络 神经与进化计算

摘要

深度学习中的超参数(HP)调优是一个昂贵的过程,对于具有数十亿参数的神经网络(NN)而言更是 prohibitively 昂贵。我们表明,在最近发现的最大更新参数化(Maximal Update Parametrization, muP)中,许多最优 HP 即使模型规模改变也保持稳定。这引出了一种我们称为 muTransfer 的新 HP 调优范式:在 muP 中参数化目标模型,在较小模型上间接调优 HP,并将其零样本迁移至全尺寸模型,即完全不直接调优后者。我们在 Transformer 和 ResNet 上验证了 muTransfer。例如,1)通过从 13M 参数模型迁移预训练 HP,我们以相当于预训练 BERT-large 一次的调优总成本,超越了已发表的 BERT-large(350M 参数)数值;2)通过从 40M 参数迁移,我们以仅占总预训练成本 7% 的调优成本,超越了已发表的 6.7B GPT-3 模型数值。我们技术的 Pytorch 实现可在 github.com/microsoft/mup 找到,并可通过 `pip install mup` 安装。

关键词

引用

@article{arxiv.2203.03466,
  title  = {Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer},
  author = {Greg Yang and Edward J. Hu and Igor Babuschkin and Szymon Sidor and Xiaodong Liu and David Farhi and Nick Ryder and Jakub Pachocki and Weizhu Chen and Jianfeng Gao},
  journal= {arXiv preprint arXiv:2203.03466},
  year   = {2022}
}

备注

NeurIPS 2021