中文

微调自适应随机优化器:通过梯度幅值直方图分析确定最优超参数$\epsilon$

机器学习 2024-09-17 v2 人工智能

摘要

随机优化器在深度神经网络模型的成功训练中起着关键作用。为获得最优模型性能,设计者必须仔细选择模型与优化器超参数。然而,此过程常在计算资源与处理时间上需求苛刻。尽管对优化器全套超参数进行调优以达峰值性能已是公认做法,但对于在如Adam优化器等主流自适应随机优化器中被误标为“低优先级”的超参数(包括保护因子ϵ\epsilon与衰减率β\beta)的个体影响仍缺乏清晰认识。在本文中,我们引入一种基于损失梯度幅值的经验概率密度函数(称为“梯度幅值直方图”)的新框架,用于透彻分析自适应随机优化器与保护超参数ϵ\epsilon。该框架揭示并论证了跨分类、语言建模与机器翻译等多种任务中超参数与最优性能之间有价值的关联与依赖。此外,我们提出一种利用梯度幅值直方图自动估计精炼且准确的最优保护超参数ϵ\epsilon搜索空间的新算法,通过确立窄至一半的最坏情形搜索空间,超越了传统的试错方法。

关键词

引用

@article{arxiv.2311.11532,
  title  = {Fine-Tuning Adaptive Stochastic Optimizers: Determining the Optimal Hyperparameter $\epsilon$ via Gradient Magnitude Histogram Analysis},
  author = {Gustavo Silva and Paul Rodriguez},
  journal= {arXiv preprint arXiv:2311.11532},
  year   = {2024}
}