中文

具有精确深度依赖性的 ReLU 网络锐表示定理

机器学习 2021-02-23 v2 机器学习

摘要

我们针对本文所定义的函数类 GD\mathcal{G}_D,在平方损失下证明了具有 DD 个 ReLU 层的神经网络的锐无维数表示结果。这些结果在如下意义下精确刻画了深度的收益:1. 通过 DD 个 ReLU 层表示函数类 GD\mathcal{G}_D 的速率在常数因子内是锐的,匹配的下界证明了这一点。2. 对每个 DDGDGD+1\mathcal{G}_{D} \subseteq \mathcal{G}_{D+1},且随着 DD 增大,函数类 GD\mathcal{G}_{D} 包含的光滑性渐弱的函数。3. 若 D<DD^{\prime} < D,则深度 DD^{\prime} 网络对类 GD\mathcal{G}_D 的逼近速率严格差于深度 DD 网络所达到的速率。这构成了对任意深度 DD 与神经元数 NN 的前馈网络表示能力的细粒度刻画,不同于现有表示结果要么要求 DDNN 快速增大、要么假设被表示函数高度光滑(在后一情形下单非线性层即可获得类似速率)。我们的结果证实了普遍假设,即更深的网络更善于表示光滑性较弱的函数,而事实上,主要技术新颖性在于充分利用深度网络能以极少激活函数产生高度振荡函数这一事实。

关键词

引用

@article{arxiv.2006.04048,
  title  = {Sharp Representation Theorems for ReLU Networks with Precise Dependence on Depth},
  author = {Guy Bresler and Dheeraj Nagaraj},
  journal= {arXiv preprint arXiv:2006.04048},
  year   = {2021}
}

备注

12 pages, 1 figure (surprisingly short isn't it?)