中文

过参数化 regime 中梯度下降的双空间预条件化

计算机视觉与模式识别 2026-03-12 v1

摘要

本文研究双空间预条件化梯度下降的收敛性,包括归一化梯度下降、梯度裁剪和 Adam 等优化器。我们考虑形如 K\nabla K 的预条件子,其中 K:RpRK: \mathbb{R}^p \to \mathbb{R} 为凸函数,并假设其用于训练过参数化线性模型,损失函数形式为 (XWY)\ell({X} {W} - {Y}),其中权重 WRd×k{W} \in \mathbb{R}^{d \times k}、标签 YRn×k{Y} \in \mathbb{R}^{n \times k} 和数据 XRn×d{X} \in \mathbb{R}^{n \times d}。在上述假设下,我们证明预条件化梯度下降的迭代始终收敛到满足 XW=Y{X}{W}_{\infty} = {Y} 的点 WRd×k{W}_{\infty} \in \mathbb{R}^{d \times k}。我们的证明技术虽独立,却引入了具有附加恒等式的新型 Bregman 发散,以建立收敛性。我们还研究了双空间预条件化梯度下降的隐式偏置。首先,我们经验性地表明,对于一般的 K()K(\cdot)W{W}_\infty 取决于所选学习率,阻碍对隐式偏置的精确刻画。然后,对于形如 K(G)=h(GF)K({G}) = h(\|{G}\|_F) 的预条件子,称为「各向同性预条件子」,我们显示 W{W}_\infty 在满足 XW=Y{X}{W}_\infty = {Y} 的条件下,最小化 WW0F2,其中\|{W}_\infty - {W}_0\|_F^2,其中 {W}_0为初始化。令GD 为初始化。令 GD 以 {W}_0初始化的收敛点记为 初始化的收敛点记为 {W}_{\text{GD}, \infty},我们由此注意到,我们由此注意到 {W}_\infty = {W}_{\text{GD}, \infty}对于各向同性预条件子。最后,我们表明类似事实也适用于一般预条件子,仅乘以常数,即 对于各向同性预条件子。最后,我们表明类似事实也适用于一般预条件子,仅乘以常数,即 \|{W}_0 - {W}_{\infty}\|_F \le c \|{W}_0 - {W}_{\text{GD}, \infty}\|_F其中 其中 c > 0$。

关键词

引用

@article{arxiv.2603.10484,
  title  = {StructDamage:A Large Scale Unified Crack and Surface Defect Dataset for Robust Structural Damage Detection},
  author = {Misbah Ijaz and Saif Ur Rehman Khan and Abd Ur Rehman and Sebastian Vollmer and Andreas Dengel and Muhammad Nabeel Asim},
  journal= {arXiv preprint arXiv:2603.10484},
  year   = {2026}
}