无学习率动量 SGD 及随机重排在非光滑非凸优化中的收敛
信息检索
2024-06-27 v1
摘要
本文提出了一种用于求解非光滑非凸函数 minimization 的通用框架,即基于历史随机次梯度和迭代数据自适应生成学习率的学习率自由动量随机梯度下降(SGD)方法。我们特别关注其在训练非光滑神经网络中的应用。在 mild 条件下,我们证明了我们提出的方法能够以保守场意义收敛到目标函数的 stationary points,从而为训练非光滑神经网络提供了收敛保证。基于我们提出的框架,我们提出了一种新型学习率自由动量 SGD 方法(LFM)。初步的数值实验表明,LFM 在众所周知的神经网络训练基准上,性能相当于已被证明在收敛性方面具有优势的学习率自由方法。
关键词
引用
@article{arxiv.2406.18286,
title = {Effects of Using Synthetic Data on Deep Recommender Models' Performance},
author = {Fatih Cihan Taskin and Ilknur Akcay and Muhammed Pesen and Said Aldemir and Ipek Iraz Esin and Furkan Durmus},
journal= {arXiv preprint arXiv:2406.18286},
year = {2024}
}