中文

冲浪法:在增量训练的深度网络上迭代优化

机器学习 2019-07-23 v1 机器学习

摘要

我们研究了一种序贯优化过程,用于最小化某些深度网络族 Gθ(x)G_{\theta}(x) 的经验风险泛函 fθ^(x)=12Gθ^(x)y2f_{\hat\theta}(x) = \frac{1}{2}\|G_{\hat\theta}(x) - y\|^2。该方法优化一系列目标函数,这些函数使用训练过程中不同阶段获得的网络参数。当以随机参数 θ0\theta_0 初始化时,我们表明目标 fθ0(x)f_{\theta_0}(x) 是“良好”的,并且易于用梯度下降优化。随着学习的进行,我们获得一系列生成网络 xGθt(x)x \mapsto G_{\theta_t}(x) 及相关的风险函数 fθt(x)f_{\theta_t}(x),其中 tt 表示训练期间随机梯度下降的一个阶段。由于网络参数在每一步中变化不大,曲面缓慢演化并可被增量优化。该算法针对一类扩张网络被形式化并分析。我们称此过程为{\it 冲浪(surfing)},因为它沿着演化的(负)经验风险函数的峰值行进,从学习开始时光滑的曲面开始,到学习完成后波浪状非凸曲面结束。实验展示了冲浪如何用于寻找全局最优,以及即使在最终学到的网络上直接梯度下降失败的情况下也可用于压缩感知。

关键词

引用

@article{arxiv.1907.08653,
  title  = {Surfing: Iterative optimization over incrementally trained deep networks},
  author = {Ganlin Song and Zhou Fan and John Lafferty},
  journal= {arXiv preprint arXiv:1907.08653},
  year   = {2019}
}