中文

基于轨迹不变性原理的高效超参数调优

机器学习 2025-09-30 v1

摘要

随着超参数调优在规模扩大时变得越来越昂贵,高效的调优方法变得至关重要。然而,指导超参数调优的原理仍然有限。在这项工作中,我们试图通过考虑包括批大小、学习率和权重衰减在内的广泛超参数来建立这样的原理。我们识别出一种称为轨迹不变性的现象,即预训练损失曲线、梯度噪声和梯度范数相对于结合学习率和权重衰减的量表现出不变性——紧密重叠。这一现象有效地将原始的二维超参数空间降维至一维,产生了一个高效的调优规则:遵循轨迹不变性揭示的显著方向。此外,我们改进了先前的缩放定律,并挑战了几个现有观点。总体而言,我们的工作提出了高效调优的新原理,并启发了未来关于缩放定律的研究。

关键词

引用

@article{arxiv.2509.25049,
  title  = {Efficient Hyperparameter Tuning via Trajectory Invariance Principle},
  author = {Bingrui Li and Jiaxin Wen and Zhanpeng Zhou and Jun Zhu and Jianfei Chen},
  journal= {arXiv preprint arXiv:2509.25049},
  year   = {2025}
}