中文

基于极限图论的 ReLU 网络中求最大值深度层次结构

机器学习 2026-01-06 v1

摘要

我们考虑使用 ReLU 神经网络对 dd 个实数输入上的最大值函数进行精确计算的问题。我们证明存在深度层次结构,即宽度 Ω(d1+12k21)\Omega\big(d^{1+\frac{1}{2^{k-2}-1}}\big) 对于表示深度为 3klog2(log2(d))3\le k\le \log_2(\log_2(d)) 的网络是必要的。这项成果是该基本算子在深度 k3k\ge3 条件下首个无条件的超线性下界,并且即使深度随 dd 增长仍然成立。我们的证明技术基于组合论,将最大值函数的非光滑脊线与计算网络第一隐藏层诱导的图中的 clique 关联,并利用 Turán 定理表明足够狭窄的网络无法捕捉最大值函数的非线性性。这表明尽管最大值函数本身简单,其仍具本征复杂性,源于其非光滑超平面几何结构,同时为证明深层神经网络下界提供了新方法。

关键词

引用

@article{arxiv.2601.01417,
  title  = {A Depth Hierarchy for Computing the Maximum in ReLU Networks via Extremal Graph Theory},
  author = {Itay Safran},
  journal= {arXiv preprint arXiv:2601.01417},
  year   = {2026}
}