中文

二次罚函数法的收敛速率分析及其在去中心化分布式优化中的应用

数值分析 2017-11-30 v1

摘要

本文研究一类用于线性约束凸问题的二次罚函数法变体,该方法已被广泛使用但缺乏理论依据。具体而言,罚参数持续增大,且罚目标函数被非精确(而非精确)最小化,例如仅使用一步近端梯度下降。对于此类二次罚函数法变体,我们给出反例说明其可能无法给出原约束问题的解。通过选取特殊罚参数,我们保证了收敛性,并进一步建立了一般凸问题的 O(1K)O\left(\frac{1}{\sqrt{K}}\right) 与强凸问题的 O(1K)O\left(\frac{1}{K}\right) 收敛速率,其中 KK 为迭代次数。此外,采用 Nesterov 外推法,我们证明一般凸问题与强凸问题的收敛速率可分别提升至 O(1K)O\left(\frac{1}{K}\right)O(1K2)O\left(\frac{1}{K^2}\right)。当应用于去中心化分布式优化时,本文所研究的罚方法即变为广泛使用的分布式梯度法与快速分布式梯度法。然而,由于完全不同的分析框架,我们能在对网络拓扑更少假设下将二者一般凸问题的 O(logKK)O\left(\frac{\log K}{\sqrt{K}}\right)O(logKK)O\left(\frac{\log K}{K}\right) 收敛速率分别提升至 O(1K)O\left(\frac{1}{\sqrt{K}}\right)O(1K)O\left(\frac{1}{K}\right)。利用我们的分析框架,还将快速分布式梯度法扩展为通信高效版本,即对非光滑问题以 O(1ε)O\left(\frac{1}{\varepsilon}\right) 次通信和 O(1ε2+δ)O\left(\frac{1}{\varepsilon^{2+\delta}}\right) 次计算找到 ε\varepsilon 解,其中 δ\delta 为小常数。

关键词

引用

@article{arxiv.1711.10802,
  title  = {Convergence Rates Analysis of The Quadratic Penalty Method and Its Applications to Decentralized Distributed Optimization},
  author = {Huan Li and Cong Fang and Zhouchen Lin},
  journal= {arXiv preprint arXiv:1711.10802},
  year   = {2017}
}