Reparameterized Steepest Descent 的镜像流为何永不落入鞍点
机器学习
2026-03-03 v1
摘要
优化算法的选择如何影响模型学习特征的能力?本文针对最陡下降方法——包括与 Adam closely related 的 sign descent ——引入最陡镜像流作为统一的理论框架。该框架揭示了优化几何如何支配学习动力学、隐式偏差以及稀疏性,并提供了两种解释,为何 Adam 和 AdamW 在微调时常优于 SGD。聚焦于对角线性网络和深层对角线性重参数化(作为注意力的简化代理),我们表明更陡的下降有助于 saddle-point 逃逸和特征学习。相比之下,梯度下降需要极大的学习率才能逃离鞍点,这在微调中并不常见。实验上,我们确认 saddle-point 逃逸是微调中的核心挑战。进一步展示,解耦权重衰减(如 AdamW 所用)通过强制新平衡方程来稳定特征学习。总之,这些结果凸显了最陡下降如何助力现代优化的两种机制。
引用
@article{arxiv.2603.02064,
title = {Never Saddle for Reparameterized Steepest Descent as Mirror Flow},
author = {Tom Jacobs and Chao Zhou and Rebekka Burkholz},
journal= {arXiv preprint arXiv:2603.02064},
year = {2026}
}