中文

预处理有助于训练过参数化神经网络吗?

机器学习 2021-10-12 v1 数据结构与算法 机器学习

摘要

深度神经网络在许多领域取得了令人印象深刻的性能。设计一种快速且可证明的神经网络训练方法是机器学习中的基本问题。经典训练方法在前向计算和反向计算上均需付出 Ω(mnd)\Omega(mnd) 的代价,其中 mm 为神经网络的宽度,给定 nndd 维空间中的训练点。本文提出两种新颖的预处理思路以突破该 Ω(mnd)\Omega(mnd) 壁垒:\bullet 首先,通过预处理神经网络的初始权重,我们可将每次迭代的训练代价降为 O~(m1Θ(1/d)nd)\widetilde{O}(m^{1-\Theta(1/d)} n d)\bullet 其次,通过预处理输入数据点,我们可将每次迭代的训练代价降为 O~(m4/5nd)\widetilde{O} (m^{4/5} nd )。从技术角度看,我们的结果是不同领域工具的精细组合:优化中的贪心型收敛分析、实际工作中的稀疏性观察、数据结构中的高维几何搜索、概率中的集中与反集中。我们的结果也为大量先前建立的快速训练方法提供了理论洞见。此外,我们的经典算法可推广到量子计算模型。有趣的是,我们可以得到类似的每次迭代亚线性代价,但无需预处理初始权重或输入数据点。

关键词

引用

@article{arxiv.2110.04622,
  title  = {Does Preprocessing Help Training Over-parameterized Neural Networks?},
  author = {Zhao Song and Shuo Yang and Ruizhe Zhang},
  journal= {arXiv preprint arXiv:2110.04622},
  year   = {2021}
}

备注

NeurIPS 2021