基于优化的神经网络分离性
机器学习
2023-02-03 v3
摘要
深度分离性结果提出了深度神经网络优于更浅架构的一种可能理论解释,确立了前者具有更优逼近能力。然而,目前尚无已知结果表明更深的架构能将此优势转化为可证明的优化保证。我们证明,当数据由满足某些温和假设的径向对称分布生成时,梯度下降可使用具有两层 sigmoid 激活且隐藏层在训练期间保持固定的深度2神经网络高效学习球指示器函数。通过构建并精炼现有的单层非线性神经网络逼近下界技术,我们表明存在数据上的 d 维径向分布,使得球指示器无法被任何算法高效学习到优于 Ω(d^{-4}) 的精度,也无法被标准梯度下降实现学习到优于常数的精度。这些结果确立了据我们所知首个基于优化的分离性,其中更强架构的逼近优势在实践中可证明地显现。我们的证明技术引入了可能独立于神经网络逼近与优化理论研究而有价值的新工具与思想。
引用
@article{arxiv.2112.02393,
title = {Optimization-Based Separations for Neural Networks},
author = {Itay Safran and Jason D. Lee},
journal= {arXiv preprint arXiv:2112.02393},
year = {2023}
}