非凸优化中 Homotopy-SGD 的收敛性分析
机器学习
2020-11-23 v1 最优化与控制
摘要
用于求解大规模非凸优化问题的一阶随机方法广泛应用于诸多大数据应用,例如训练深度神经网络以及其他复杂且可能非凸的机器学习模型。其低廉的迭代代价通常伴随缓慢的全局收敛速率(多为次线性),导致迭代点到达极小点邻域前须执行极多次迭代。本文提出一种基于同伦方法与 SGD 结合的一阶随机算法,称为 Homotopy-随机梯度下降(H-SGD),其与文献中若干启发式方法(如高斯延拓优化、扩散训练、平滑网络)存在有趣联系。在对问题结构作温和假设下,我们对所提算法进行理论分析。分析表明,借助专门设计的同伦参数方案,H-SGD 在保持快速且低廉迭代的同时,对极小点邻域具有全局线性收敛速率。实验评估证实了理论结果,并表明 H-SGD 可优于标准 SGD。
引用
@article{arxiv.2011.10298,
title = {Convergence Analysis of Homotopy-SGD for non-convex optimization},
author = {Matilde Gargiani and Andrea Zanelli and Quoc Tran-Dinh and Moritz Diehl and Frank Hutter},
journal= {arXiv preprint arXiv:2011.10298},
year = {2020}
}
备注
21 pages, 14 figures, technical report