中文

随规模而调:面向计算高效训练的超参数优化

机器学习 2023-06-16 v1 人工智能

摘要

深度学习模型的超参数调优可在相同计算量下带来数量级的性能提升。尽管如此,系统性调优并不常见,尤其对大型模型而言——它们评估代价高昂且往往具有众多超参数,需要在权衡、预算与搜索边界上作出困难判断。为解决这些问题并提出一种鲁棒调优大型模型的实用方法,我们提出成本感知帕累托区域贝叶斯搜索(CARBS),一种在性能-成本帕累托前沿周围执行局部搜索的贝叶斯优化算法。CARBS即使在具有许多超参数的无界搜索空间中也表现良好,学习缩放关系从而可在模型扩展时调优,并自动化了调优中大量的“黑魔法”。在我们的结果中,仅通过调优一个简单基线(PPO,如原始ProcGen论文所提供)就有效解决了整个ProcGen基准。我们还复现了Chinchilla项目(Hoffmann et al. 2022)的模型规模vs.训练词元缩放结果,同时通过简易自动化流程发现了每个其他超参数的缩放律,该流程计算量显著更少且适用于任何深度学习问题(不仅限于语言模型)。

关键词

引用

@article{arxiv.2306.08055,
  title  = {Tune As You Scale: Hyperparameter Optimization For Compute Efficient Training},
  author = {Abraham J. Fetterman and Ellie Kitanidis and Joshua Albrecht and Zachary Polizzi and Bryden Fogelman and Maksis Knutins and Bartosz Wróblewski and James B. Simon and Kanjun Qiu},
  journal= {arXiv preprint arXiv:2306.08055},
  year   = {2023}
}