训练深度2 ReLU 网络的紧致困难性结果
机器学习
2020-11-30 v1 计算复杂性
数据结构与算法
摘要
我们证明了训练具有 ReLU 激活函数的深度2神经网络的若干困难性结果;这些网络仅是 ReLU 的加权和(可包含负系数)。我们的目标是输出一个深度2神经网络,使其相对于给定训练集的平方损失最小化。我们证明该问题即便对于仅含单个 ReLU 的网络已是 NP-hard。我们还证明了输出最小化平方误差的 个 ReLU 加权和(对于 )即使在可实现设定下(即标签与某个未知深度2 ReLU 网络一致)也是 NP-hard。我们还能就期望的加性误差 给出运行时间的下界。为获得下界,我们使用了间隙指数时间假设(Gap-ETH)以及一条关于在亚指数时间内逼近著名的稠密 -子图问题困难性的新假设(这些假设在证明不同下界时分别使用)。例如,我们证明在合理的困难性假设下,任何用于寻找最佳拟合 ReLU 的恰当学习算法必须以关于 指数级的时间运行。结合先前关于不恰当地学习 ReLU 的工作(Goel 等人,COLT'17),这暗示了学习 ReLU 的恰当与不恰当算法之间的首次分离。我们还研究了恰当学习具有有界权重的深度2 ReLU 网络的问题,给出了在可实现与不可知设定下学习此类网络所需运行时间的新的(最坏情况)上界。我们的运行时间上界在关于 的依赖性上基本与下界匹配。
引用
@article{arxiv.2011.13550,
title = {Tight Hardness Results for Training Depth-2 ReLU Networks},
author = {Surbhi Goel and Adam Klivans and Pasin Manurangsi and Daniel Reichman},
journal= {arXiv preprint arXiv:2011.13550},
year = {2020}
}
备注
To appear in ITCS'21