深度神经网络在稀疏参数空间上学习的最小最大最优性与优越性
机器学习
2023-05-31 v2 机器学习
统计理论
统计理论
摘要
深度学习已应用于机器学习领域的各种任务,并显示出优于核方法等其他常用方法的性能。为更好地从理论理解其成功原因,我们讨论深度学习与其他方法在带高斯噪声的非参数回归问题上的表现。现有深度学习的理论研究主要基于 H"{o}lder 和 Besov 等已知函数类的数学理论,而我们关注具有不连续性与稀疏性的函数类,这类函数类是实践中自然假设的。为凸显深度学习的有效性,我们将深度学习而与一类代表浅层估计器的线性估计器进行比较。我们证明,线性估计器在目标函数类凸包上的最小最大风险与原目标函数类并无差异。这导致线性方法在一个简单但非凸的函数类上非最优,而深度学习可在该类上达到近最小最大最优速率。除这一极端情形外,我们考虑具有稀疏小波系数的函数类。在这些函数类上,深度学习也达到至多含样本量对数因子的最小最大速率,而若假设稀疏性较强,线性方法仍非最优。我们还指出,在我们设定下深度神经网络的参数共享可显著减小模型的复杂度。
引用
@article{arxiv.1905.09195,
title = {On the minimax optimality and superiority of deep neural network learning over sparse parameter spaces},
author = {Satoshi Hayakawa and Taiji Suzuki},
journal= {arXiv preprint arXiv:1905.09195},
year = {2023}
}
备注
33 pages