张量程序 V:通过零样本超参数迁移调优大型神经网络
机器学习
2022-03-29 v2 无序系统与神经网络
神经与进化计算
摘要
深度学习中的超参数(HP)调优是一个昂贵的过程,对于具有数十亿参数的神经网络(NN)而言更是 prohibitively 昂贵。我们表明,在最近发现的最大更新参数化(Maximal Update Parametrization, muP)中,许多最优 HP 即使模型规模改变也保持稳定。这引出了一种我们称为 muTransfer 的新 HP 调优范式:在 muP 中参数化目标模型,在较小模型上间接调优 HP,并将其零样本迁移至全尺寸模型,即完全不直接调优后者。我们在 Transformer 和 ResNet 上验证了 muTransfer。例如,1)通过从 13M 参数模型迁移预训练 HP,我们以相当于预训练 BERT-large 一次的调优总成本,超越了已发表的 BERT-large(350M 参数)数值;2)通过从 40M 参数迁移,我们以仅占总预训练成本 7% 的调优成本,超越了已发表的 6.7B GPT-3 模型数值。我们技术的 Pytorch 实现可在 github.com/microsoft/mup 找到,并可通过 `pip install mup` 安装。
引用
@article{arxiv.2203.03466,
title = {Tensor Programs V: Tuning Large Neural Networks via Zero-Shot Hyperparameter Transfer},
author = {Greg Yang and Edward J. Hu and Igor Babuschkin and Szymon Sidor and Xiaodong Liu and David Farhi and Nick Ryder and Jakub Pachocki and Weizhu Chen and Jianfeng Gao},
journal= {arXiv preprint arXiv:2203.03466},
year = {2022}
}
备注
NeurIPS 2021