中文

隐藏在眼前的优化器:基于损失景观诱导度量的训练

机器学习 2025-09-05 v1 人工智能 最优化与控制

摘要

我们提出了一类新的神经网络训练优化器,利用损失景观嵌入在更高维空间中自然诱导的黎曼度量。这就是我们常用于可视化损失景观的度量。通过从几何视角出发并利用诱导度量,我们开发了新的优化器,并将其与现有方法(包括SGD、Adam、AdamW和Muon)在各种任务和体系结构上进行比较。经验上,我们得出结论,这种新的优化器类在低维示例中效果极佳,在训练神经网络时提供了对SOTA方法的轻微改进。这些新的优化器具有理论上的优良特性。特别是,有效学习率在高曲率区域自动降低,充当了梯度剪裁的平滑形式。类似地,这些优化器的一个变体还可被视为诱导有效的计划学习率,解耦权重衰减是我们几何视角下的自然选择。基本方法可用于修改任何现有的预条件化方法。新的优化器的计算复杂度与Adam相当。

关键词

引用

@article{arxiv.2509.03594,
  title  = {The Optimiser Hidden in Plain Sight: Training with the Loss Landscape's Induced Metric},
  author = {Thomas R. Harvey},
  journal= {arXiv preprint arXiv:2509.03594},
  year   = {2025}
}

备注

https://github.com/harveyThomas4692/Induced-Metric-Optimiser