中文

梯度的滞留:理论与应用

最优化与控制 2019-05-29 v2 数据结构与算法 机器学习 机器学习

摘要

经典地,一阶方法的时间复杂度由其梯度计算次数估计。本文通过考虑梯度的“滞留”来研究一种更精细的复杂度:一旦在 xkx_k 处计算出梯度,在 xk+1,xk+2,x_{k+1},x_{k+2},\dots 处计算梯度的附加时间可能减少。我们展示这如何改善若干一阶方法的运行时间。例如,若“附加时间”相对于行进距离线性缩放,则梯度下降的“收敛速率”可从 1/T1/T 改进为 exp(T1/3)\exp(-T^{1/3})。在应用方面,我们在 Yahoo! Front Page Today Module 上以 4.6m 用户、仅 6 遍数据集解决了假设收益管理问题至 10610^{-6} 误差;并将一个真实支持向量机问题的精度求解到比最先进算法好两个数量级。

关键词

引用

@article{arxiv.1901.02871,
  title  = {The Lingering of Gradients: Theory and Applications},
  author = {Zeyuan Allen-Zhu and David Simchi-Levi and Xinshang Wang},
  journal= {arXiv preprint arXiv:1901.02871},
  year   = {2019}
}