使用 NAdamW 预计算超参数列表实现快速训练与最少调参
机器学习
2025-03-07 v1 人工智能
摘要
如果我们想使用任何最流行的优化算法来训练神经网络,就会立即面临一个困境:如何设置各种优化和正则化超参数?当计算资源充足时,有多种方法可以找到良好的超参数设置,但当资源有限时,唯一现实的选择是使用质量与来源不确定的标准默认值,或者仅通过极其有限的预设搜索来调整最重要的几个超参数。Metz 等人(2020)将默认设置的思想扩展到适度的调参预算,提出使用从大规模训练工作负载库上的广泛超参数搜索中得出的性能良好的有序超参数列表。然而,到目前为止,还没有展示出能够推广到代表性深度学习工作负载的实用且高性能的超参数列表。在本文中,我们提出了从 AlgoPerf:训练算法基准中的真实工作负载上的广泛实验中得出的 NAdamW 超参数列表。我们的超参数列表还包括基本正则化技术(即权重衰减、标签平滑和丢弃)的值。特别是,我们最佳的 NAdamW 超参数列表在用于构建它的 AlgoPerf 保留工作负载上表现良好,并且代表了一种在限制为五次或更少试验时的有吸引力的开箱即用调参方法。它还优于在相同预算下限制的基本学习率/权重衰减搜索以及现成的贝叶斯优化工具。
引用
@article{arxiv.2503.03986,
title = {Training neural networks faster with minimal tuning using pre-computed lists of hyperparameters for NAdamW},
author = {Sourabh Medapati and Priya Kasimbeg and Shankar Krishnan and Naman Agarwal and George Dahl},
journal= {arXiv preprint arXiv:2503.03986},
year = {2025}
}
备注
Good defaults for NadamW Optimizer, generalizes well to unseen problems