中文

基于朗之万动力学、面向具有不连续随机梯度随机优化问题的算法 e-TH$\varepsilon$O POULA

最优化与控制 2024-07-02 v3 机器学习 数值分析 数值分析 概率论 机器学习

摘要

我们提出一种基于朗之万动力学的新算法,称为 e-THε\varepsilonO POULA,用于求解具有不连续随机梯度的优化问题,这类问题自然出现在分位数估计、矢量量化、CVaR 最小化以及涉及 ReLU 神经网络的正则化优化等现实应用中。我们从理论和数值两方面证明了 e-THε\varepsilonO POULA 算法的适用性。更确切地说,在随机梯度平均意义下局部 Lipschitz 且满足某种无穷远凸性条件的假设下,我们建立了 e-THε\varepsilonO POULA 在 Wasserstein 距离下的非渐近误差界,并给出了期望超额风险的非渐近估计,该风险可被控制得任意小。我们给出了金融与保险领域的三个关键应用,即多期投资组合优化、多期投资组合优化中的迁移学习,以及保险理赔预测,这些应用涉及具有(带泄漏的)ReLU 激活函数的神经网络。使用真实世界数据集进行的数值实验表明,在模型精度方面,e-THε\varepsilonO POULA 相较于 SGLD、TUSLA、ADAM 和 AMSGrad 具有更优的经验性能。

关键词

引用

@article{arxiv.2210.13193,
  title  = {Langevin dynamics based algorithm e-TH$\varepsilon$O POULA for stochastic optimization problems with discontinuous stochastic gradient},
  author = {Dong-Young Lim and Ariel Neufeld and Sotirios Sabanis and Ying Zhang},
  journal= {arXiv preprint arXiv:2210.13193},
  year   = {2024}
}