基于切比雪夫步长的收敛加速:深度展开梯度下降的一种合理解释
机器学习
2020-10-27 v1 信息论
信号处理
math.IT
机器学习
摘要
深度展开是一种很有前景的深度学习技术,其网络架构基于现有迭代算法的递归结构展开。尽管收敛加速是深度展开的一个显著优势,但其理论方面尚未被揭示。本研究前半部分详细分析了可训练参数为步长的深度展开梯度下降(DUGD)中的收敛加速理论。我们通过引入由切比雪夫多项式导出的切比雪夫步长原理,对DUGD中学习到的步长参数提出一种合理解释。在梯度下降(GD)中使用切比雪夫步长,使我们能够界定控制GD收敛速度的矩阵谱半径,从而得到收敛率的一个紧上界。研究表明,使用切比雪夫步长的GD收敛率渐近最优,尽管其不含动量项。我们还表明切比雪夫步长能很好地数值解释DUGD中学习到的步长参数。研究后半部分,我们将切比雪夫步长理论应用于加速线性/非线性不动点迭代,并提出切比雪夫周期逐次超松弛(Chebyshev-PSOR)。理论分析与数值实验表明,Chebyshev-PSOR在Jacobi方法和近端梯度方法等多种算例上均展现出显著更快的收敛。
引用
@article{arxiv.2010.13335,
title = {Convergence Acceleration via Chebyshev Step: Plausible Interpretation of Deep-Unfolded Gradient Descent},
author = {Satoshi Takabe and Tadashi Wadayama},
journal= {arXiv preprint arXiv:2010.13335},
year = {2020}
}
备注
17 pages, 22 figures, This manuscript is the revised and updated version of arXiv:2001.03280 and arXiv:2001.05142