中文

凸且光滑噪声优化的梯度下降法

最优化与控制 2025-04-02 v5

摘要

我们研究了使用带回溯线搜索的梯度下降法(GD-BLS)来求解噪声优化问题 θ:=argminθRdE[f(θ,Z)]\theta_\star:=\mathrm{argmin}_{\theta\in\mathbb{R}^d} \mathbb{E}[f(\theta,Z)],其中假设函数 F(θ):=E[f(θ,Z)]F(\theta):=\mathbb{E}[f(\theta,Z)] 是严格凸的,但不一定是 LL-光滑的。在假设 E[θf(θ,Z)2]<\mathbb{E}[\|\nabla_\theta f(\theta_\star,Z)\|^2]<\infty 的条件下,我们首先证明基于GD-BLS的样本平均近似法能够以 OP(B0.25)\mathcal{O}_{\mathbb{P}}(B^{-0.25}) 的误差规模估计 θ\theta_\star,其中 BB 是可用的计算预算。然后我们证明,通过在目标函数的梯度足够接近零时提前停止优化过程,并利用剩余的计算预算再次使用GD-BLS优化 FF 的一个更精细的近似,我们可以改进这一速率。通过迭代应用此策略 JJ 次,我们确定能够以 OP(B12(1δJ))\mathcal{O}_{\mathbb{P}}(B^{-\frac{1}{2}(1-\delta^{J})}) 的误差规模估计 θ\theta_\star,其中 δ(1/2,1)\delta\in(1/2,1) 是一个用户指定的参数。更一般地,我们证明如果对于某个已知的 α(0,1]\alpha\in (0,1]E[θf(θ,Z)1+α]<\mathbb{E}[\|\nabla_\theta f(\theta_\star,Z)\|^{1+\alpha}]<\infty,那么这种方法(可视为具有固定计算预算的回顾近似算法)能够以 OP(Bα1+α(1δJ))\mathcal{O}_{\mathbb{P}}(B^{-\frac{\alpha}{1+\alpha}(1-\delta^{J})}) 的误差规模学习 θ\theta_\star,其中 δ(2α/(1+3α),1)\delta\in(2\alpha/(1+3\alpha),1) 是一个调节参数。除了需要知道 α\alpha 之外,实现上述收敛速率不需要根据具体的函数 FFff 来调整算法参数,并且我们展示了一个简单的噪声优化问题,对于该问题,随机梯度法不能保证收敛,而本文讨论的算法则可以。

关键词

引用

@article{arxiv.2405.06539,
  title  = {Gradient Descent for Convex and Smooth Noisy Optimization},
  author = {Feifei Hu and Mathieu Gerber},
  journal= {arXiv preprint arXiv:2405.06539},
  year   = {2025}
}

备注

40 pages, 3 figures