中文

基于加速对偶平均的有限和优化方差缩减

最优化与控制 2021-03-09 v4 机器学习

摘要

本文针对有限和凸优化问题提出了一种简化且统一的方法,命名为基于加速对偶平均的方差缩减(VRADA)。在一般凸和强凸设置下,VRADA 均可通过 O(nloglogn)O(n\log\log n) 次随机梯度计算达到 O(1n)O\big(\frac{1}{n}\big) 精度的解,改进了已知最优的 O(nlogn)O(n\log n) 结果,其中 nn 为样本数。同时,在一般凸设置下,VRADA 的复杂度与下界仅相差一个 loglogn\log\log n 因子;在强凸设置下,当 nΘ(κ)n\le \Theta(\kappa)nκn\gg \kappa 时,其复杂度均匹配下界,其中 κ\kappa 表示条件数。除了改进已知最优结果并同时匹配上述所有下界外,VRADA 在一般凸和强凸设置下具有更统一和简化的算法实现与收敛性分析。VRADA 中所采用的新颖初始化策略等底层新方法可能具有独立的研究价值。通过在真实数据集上的实验,我们展示了 VRADA 在大规模机器学习问题中优于现有方法的良好性能。

关键词

引用

@article{arxiv.2006.10281,
  title  = {Variance Reduction via Accelerated Dual Averaging for Finite-Sum Optimization},
  author = {Chaobing Song and Yong Jiang and Yi Ma},
  journal= {arXiv preprint arXiv:2006.10281},
  year   = {2021}
}

备注

19 pages, 12 figures