为何选择ReLU?深度网络训练的位模型二分法
机器学习
2026-02-24 v1
摘要
经验风险最小化(ERM)的理论分析通常以实数-RAM计算模型呈现。在此设置下,即使是简单的神经网络训练已知为-complete——一种被认为比NP更难的复杂度类, characterize解决给定实数不等式系统的难度。然而,这种代数框架与有限精度硬件的数字计算现实相背离。在本工作中,我们在现实的位级模型()下分析ERM的理论复杂度,其中网络参数和输入受到多项式界限位长的有理数约束。在此模型下,我们揭示了由网络激活函数控制的可解决性的尖锐二分法。我们证明,对于具有任何多项式激活函数(具有理性系数且至少二次)的深度网络,位复杂度严重:决定是-Hard的,因此被认为严格比NP-complete问题更难。此外,我们表明,确定经验损失函数单个偏导数的符号是不可解的(不太可能在BPP中),以及决定梯度的特定位是-Hard的。这提供了一个复杂度论视角来解释梯度爆炸和消失现象。相反,我们表明,对于分段线性激活函数(如ReLU),精度要求保持可管理:包含在NP中(具体为NP-complete),且标准反向传播可在多项式时间内运行。我们的结果表明,有限精度约束不仅是实现细节,而是可学习性的根本决定因素。
引用
@article{arxiv.2602.19017,
title = {Why ReLU? A Bit-Model Dichotomy for Deep Network Training},
author = {Ilan Doron-Arad and Elchanan Mossel},
journal= {arXiv preprint arXiv:2602.19017},
year = {2026}
}