中文

真正的无超参数学习算法还有多远?

机器学习 2025-06-02 v1

摘要

尽管在方法论上取得了重大进展,超参数调优仍然是机器学习系统开发中至关重要(且昂贵)的一部分。即使忽略架构选择,深度神经网络也有大量的优化和正则化超参数,需要针对每个任务进行仔细调优才能获得最佳结果。在理想情况下,训练算法不需要针对特定任务进行超参数调优,而是具有在许多任务上都能表现良好的默认设置。最近,关于尝试减少超参数数量(特别是学习率及其伴随的调度)的优化方法的文献越来越多。鉴于这些进展,完全消除痛苦调优需求的神经网络训练算法的梦想还有多远?在本文中,我们评估了无学习率方法作为无超参数方法组件的潜力。我们将其(非学习率)超参数冻结为默认值,并使用最近提出的 AlgoPerf: Training Algorithms 基准对其性能进行评分。我们发现文献提供的默认设置在该基准上表现不佳,因此我们搜索了在所有任务上同时表现良好的超参数配置。经过 AlgoPerf 校准的最佳无学习率方法性能有了大幅提升,但在总体基准得分上仍略落后于经过类似校准的 NadamW 基线。我们的结果表明,无学习率方法仍有很大的改进空间,并且针对强大的、与任务无关的基线进行测试对于改进超参数减少技术非常重要。

关键词

引用

@article{arxiv.2505.24005,
  title  = {How far away are truly hyperparameter-free learning algorithms?},
  author = {Priya Kasimbeg and Vincent Roulet and Naman Agarwal and Sourabh Medapati and Fabian Pedregosa and Atish Agarwala and George E. Dahl},
  journal= {arXiv preprint arXiv:2505.24005},
  year   = {2025}
}