过参数化 regime 中梯度下降的双空间预条件化
计算机视觉与模式识别
2026-03-12 v1
摘要
本文研究双空间预条件化梯度下降的收敛性,包括归一化梯度下降、梯度裁剪和 Adam 等优化器。我们考虑形如 的预条件子,其中 为凸函数,并假设其用于训练过参数化线性模型,损失函数形式为 ,其中权重 、标签 和数据 。在上述假设下,我们证明预条件化梯度下降的迭代始终收敛到满足 的点 。我们的证明技术虽独立,却引入了具有附加恒等式的新型 Bregman 发散,以建立收敛性。我们还研究了双空间预条件化梯度下降的隐式偏置。首先,我们经验性地表明,对于一般的 , 取决于所选学习率,阻碍对隐式偏置的精确刻画。然后,对于形如 的预条件子,称为「各向同性预条件子」,我们显示 在满足 的条件下,最小化 {W}_0{W}_0{W}_{\text{GD}, \infty}{W}_\infty = {W}_{\text{GD}, \infty}\|{W}_0 - {W}_{\infty}\|_F \le c \|{W}_0 - {W}_{\text{GD}, \infty}\|_Fc > 0$。
关键词
引用
@article{arxiv.2603.10484,
title = {StructDamage:A Large Scale Unified Crack and Surface Defect Dataset for Robust Structural Damage Detection},
author = {Misbah Ijaz and Saif Ur Rehman Khan and Abd Ur Rehman and Sebastian Vollmer and Andreas Dengel and Muhammad Nabeel Asim},
journal= {arXiv preprint arXiv:2603.10484},
year = {2026}
}