高斯平滑随机梯度的性能改进
最优化与控制
2024-11-19 v3
摘要
本文形式化并分析了应用于深度学习中两种著名优化方法的高斯平滑:随机梯度下降(GSmoothSGD)与 Adam(GSmoothAdam)。通过衰减小幅波动,高斯平滑降低了基于梯度的算法收敛到较差局部极小值的危险。这些方法在简化损失地貌的同时增强了对噪声的鲁棒性并改善泛化能力,帮助基础算法更有效地收敛到全局极小值。现有方法常依赖零阶近似,因自动微分的低效而增加了训练时间。为此,我们推导了前馈网络与卷积网络的高斯平滑损失函数,提升了计算效率。数值实验表明我们的平滑算法相较未平滑对应算法性能更优,证实了理论收益。
引用
@article{arxiv.2311.00531,
title = {Improved Performance of Stochastic Gradients with Gaussian Smoothing},
author = {Andrew Starnes and Clayton Webster},
journal= {arXiv preprint arXiv:2311.00531},
year = {2024}
}
备注
41 pages, 9 figures