非凸随机 Bregman 近端梯度法及其在深度学习中的应用
最优化与控制
2025-01-22 v5 机器学习
摘要
用于最小化非凸复合目标函数的随机梯度方法通常依赖于可微部分的 Lipschitz 光滑性,但这一假设在诸多重要问题类(如二次逆问题与神经网络训练)中不成立,导致算法在理论与实践上的不稳定性。为此,我们提出一类仅需光滑自适应性的随机 Bregman 近端梯度(SBPG)方法。SBPG 以 Bregman 邻近度量替代 SGD 中的二次近似,提供了能处理非凸目标中非 Lipschitz 梯度的更优近似模型。我们建立了朴素 SBPG 的收敛性质,并证明其在非凸设定下达到最优样本复杂度。在二次逆问题上的实验结果表明了 SBPG 在步长选择与对初值敏感性方面的鲁棒性。此外,我们引入基于动量的变体 MSBPG,其在保持最优预言复杂度的同时,通过放宽小批量大小要求来增强收敛。我们将 MSBPG 应用于深度神经网络训练,利用多项式核函数确保损失函数的光滑自适应性。在基准数据集上的实验结果证实了 MSBPG 在神经网络训练中的有效性与鲁棒性。鉴于其在大规模优化中相比 SGD 的额外计算成本可忽略,MSBPG 有望成为未来应用中通用的开源优化器。
引用
@article{arxiv.2306.14522,
title = {Nonconvex Stochastic Bregman Proximal Gradient Method with Application to Deep Learning},
author = {Kuangyu Ding and Jingyang Li and Kim-Chuan Toh},
journal= {arXiv preprint arXiv:2306.14522},
year = {2025}
}
备注
44 pages