中文

球面上的截断核随机梯度下降

机器学习 2025-07-17 v6

摘要

灵感来自球谐函数的结构,我们提出了用于球面数据拟合的截断核随机梯度下降 (T-kernel SGD) 算法,采用最小二乘损失函数。T-kernel SGD 通过实现低维子空间中随机梯度投影的闭式解,引入了一种新颖的正则化策略,以实现随机梯度下降。与传统核 SGD 不同,T-kernel SGD 所实施的正则化策略在动态调整假设空间期间,更有效地平衡偏差和方差。最显著的优势是,该算法能够使用常数步长(与样本量无关)实现理论上最优的收敛速率,同时克服了核 SGD 固有的饱和问题。此外,我们利用球面多项式的结构导出等效的 T-kernel SGD,显著降低了存储和计算成本。通常情况下,T-kernel SGD 仅需 O(n1+dd1ϵ)\mathcal{O}(n^{1+\frac{d}{d-1}\epsilon}) 的计算复杂度和 O(ndd1ϵ)\mathcal{O}(n^{\frac{d}{d-1}\epsilon}) 的存储空间即可为 d 维球面实现最优速率,其中 0<ϵ<120<\epsilon<\frac{1}{2} 可任意小,前提是最优拟合或底层空间具有足够的光滑性。这种光滑性由目标函数的光滑性参数以及核函数相关积分算子特征值的衰减率决定,后者反映了估计问题的难易程度。我们的主要结果定量地刻画了这种先验信息如何影响 T-kernel SGD 的收敛。数值实验进一步验证了本文所述的理论发现。

关键词

引用

@article{arxiv.2410.01570,
  title  = {Truncated Kernel Stochastic Gradient Descent on Spheres},
  author = {Jinhui Bai and Lei Shi},
  journal= {arXiv preprint arXiv:2410.01570},
  year   = {2025}
}

备注

74 pages, 22 figures