双曲感知最小化:稀疏性的隐式偏差
机器学习
2026-03-03 v2
摘要
理解优化算法的隐式偏差是解释和改进深度模型泛化能力的关键。由逐点过参数化引起的双曲隐式偏差促进了稀疏性,但也在零附近产生了较小的逆黎曼度量,减慢了参数移动并阻碍了有意义的参数符号翻转。为了克服这一障碍,我们提出了双曲感知最小化(HAM),它将标准优化器步骤与轻量级的双曲镜像步骤交替进行。该镜像步骤比逐点过参数化消耗更少的计算和内存,重现了其对特征学习有益的双曲几何,并缓解了逆度量过小的瓶颈。我们在欠定线性回归背景下对隐式偏差进行了刻画,为 HAM 持续提升性能的机制提供了见解——正如我们在标准视觉基准实验中所展示的,即使在稠密训练情况下也是如此。HAM 与不同的稀疏化方法结合尤为有效,推进了当前的技术水平。
引用
@article{arxiv.2506.02630,
title = {Hyperbolic Aware Minimization: Implicit Bias for Sparsity},
author = {Tom Jacobs and Advait Gadhikar and Celia Rubio-Madrigal and Rebekka Burkholz},
journal= {arXiv preprint arXiv:2506.02630},
year = {2026}
}
备注
38 pages, 12 figures