量化可微学习相对于切核方法的优势
机器学习
2021-03-02 v1 机器学习
摘要
我们研究了在可微模型(如神经网络)上通过梯度下降进行学习,与使用相应切核(tangent kernel)方法学习之间的相对能力。我们表明,在某些条件下,梯度下降仅当相关的切核方法取得相对于随机猜测的非平凡优势(即弱学习)时才能实现小误差,尽管即使梯度下降可以达到任意高的精度,该优势也可能非常小。作为补充,我们表明,若不满足这些条件,即使任何核方法(特别是使用切核的方法)都无法取得相对于随机猜测的非平凡优势,梯度下降实际上仍可以以小误差学习。
引用
@article{arxiv.2103.01210,
title = {Quantifying the Benefit of Using Differentiable Learning over Tangent Kernels},
author = {Eran Malach and Pritish Kamath and Emmanuel Abbe and Nathan Srebro},
journal= {arXiv preprint arXiv:2103.01210},
year = {2021}
}