中文

高效持续有限求和最小化

最优化与控制 2024-06-10 v1 机器学习

摘要

给定函数序列 f1,,fnf_1,\ldots,f_n,其中 fi:DRf_i:\mathcal{D}\mapsto \mathbb{R},有限求和最小化寻求一点 xD{x}^\star \in \mathcal{D} 以最小化 j=1nfj(x)/n\sum_{j=1}^n f_j(x)/n。本文提出一种对有限求和最小化的关键改进,称为持续有限求和最小化,要求得到一序列点 x1,,xnD{x}_1^\star,\ldots,{x}_n^\star \in \mathcal{D},使得每个 xiD{x}^\star_i \in \mathcal{D} 最小化前缀求和 j=1ifj(x)/i\sum_{j=1}^if_j(x)/i。假设每个前缀求和均为强凸函数,我们发展一种一阶持续随机方差归约梯度方法(CSVRG\mathrm{CSVRG}),产生一个 ϵ\epsilon-最优序列,总计使用 O~(n/ϵ1/3+1/ϵ)\mathcal{\tilde{O}}(n/\epsilon^{1/3} + 1/\sqrt{\epsilon}) 个一阶算子(FO)。一阶算子对应于在给定 xDx \in \mathcal{D} 处计算单个梯度 fj(x)\nabla f_j(x),其中 j[n]j \in [n]。我们的 метод显著改进了 StochasticGradientDescent\mathrm{StochasticGradientDescent} 需要的 O(n/ϵ)\mathcal{O}(n/\epsilon) 个 FO 以及 Katyusha\mathrm{Katyusha} 等最新方差归约方法需要的 O(n2log(1/ϵ))\mathcal{O}(n^2 \log (1/\epsilon)) 个 FO。我们还证明了不存在具有 O(n/ϵα)\mathcal{O}\left(n/\epsilon^\alpha\right) 梯度复杂度的自然一阶方法,其中 α<1/4\alpha < 1/4,从而确立了本方法的一阶复杂度接近紧密。

关键词

引用

@article{arxiv.2406.04731,
  title  = {Efficient Continual Finite-Sum Minimization},
  author = {Ioannis Mavrothalassitis and Stratis Skoulakis and Leello Tadesse Dadi and Volkan Cevher},
  journal= {arXiv preprint arXiv:2406.04731},
  year   = {2024}
}

备注

Accepted in ICLR 2024, 35 pages