中文

关于两层神经网络的鲁棒性定律

机器学习 2020-11-26 v2 机器学习

摘要

我们开启了对神经网络规模与其鲁棒性(以 Lipschitz 常数度量)之间固有权衡的研究。我们提出一个精确猜想:对于任意 Lipschitz 激活函数和大多数数据集,任何具有 kk 个神经元且完美拟合数据的两层神经网络,其 Lipschitz 常数必然(至多差一个常数因子)大于 n/k\sqrt{n/k},其中 nn 为数据点数量。特别地,该猜想意味着过参数化对鲁棒性是必要的,因为这意味着需要大约每个数据点一个神经元才能保证 O(1)O(1)-Lipschitz 网络,而仅对 dd 维数据进行拟合只需每 dd 个数据点一个神经元。当用基于权重矩阵谱范数的上界替代 Lipschitz 常数时,我们证明了该猜想的一个较弱版本。我们还证明了高维情形 ndn \approx d(我们也称之为欠完备情形,因为此处仅 kdk \leq d 相关)下的猜想。最后,对于次数 pp 的多项式激活函数且 ndpn \approx d^p 时,我们证明了该猜想。我们以支持该猜想的实验证据补充了这些发现。

关键词

引用

@article{arxiv.2009.14444,
  title  = {A law of robustness for two-layers neural networks},
  author = {Sébastien Bubeck and Yuanzhi Li and Dheeraj Nagaraj},
  journal= {arXiv preprint arXiv:2009.14444},
  year   = {2020}
}

备注

18 pages, 3 figures. V2: improved Theorem 4 (weaker version of the Conjecture with $n$ replaced by $d$) from ReLU with no bias term in V1, to arbitrary non-linearities (even data-dependent) in V2