强凸条件下 alpha-SVRG 的收敛性分析
机器学习
2025-03-18 v1 统计计算
机器学习
摘要
用于经验风险最小化的随机一阶方法基于采样数据构造梯度近似以替代精确梯度。此类构造在学习动力学中引入噪声,可通过方差缩减技术进行修正。文献中越来越多的证据表明,在许多现代学习应用中,噪声对优化和泛化具有有益作用。为此,最近提出的方差缩减技术 alpha-SVRG [Yin et al., 2023] 允许对学习动力学中残余噪声水平进行精细控制,并已在现代深度学习场景中报告优于SGD和SVRG的经验性能。我们聚焦于强凸环境,首先给出了alpha-SVRG在固定学习率下的统一收敛速率表达式,通过设置 alpha=0 或 alpha=1 分别退化为SGD或SVRG的收敛速率。我们证明,在alpha的适当选择下,alpha-SVRG具有比SGD和SVRG更快的收敛速率。线性回归上的仿真结果验证了我们的理论。
引用
@article{arxiv.2503.12454,
title = {Convergence Analysis of alpha-SVRG under Strong Convexity},
author = {Sean Xiao and Sangwoo Park and Stefan Vlaski},
journal= {arXiv preprint arXiv:2503.12454},
year = {2025}
}
备注
ICASSP 2025