论离散训练深度神经网络的困难性
机器学习
2024-12-18 v1
摘要
我们研究神经网络训练(NNT):优化神经网络的参数以最小化给定数据集上的训练损失。NNT 已在理论视角下得到广泛研究,主要集中在具有线性或 ReLU 激活函数且参数可取任意实值的两层网络上(此处称为连续 NNT(C-NNT))。然而,对于在实践中表现出更强能力的更深神经网络,人们知之甚少。此外,尽管具有理论和实际意义,但该问题的离散变体(简称 D-NNT,其中参数取自给定的有限选项集)的复杂性却较少被探索。在这项工作中,我们表明 NNT 的困难性受网络深度的显著影响。具体而言,我们证明,在标准复杂性假设下,即使对于具有固定维度和数据集大小且具有深度架构的实例,D-NNT 也不属于复杂类 NP。这将 D-NNT 与任何 NP 完全问题区分开来。此外,通过多项式归约,我们表明上述结果同样适用于 C-NNT,尽管是在更具结构化的实例上。我们用两层网络上 D-NNT 的 NP 困难性下界的全面列表补充了这些结果,表明固定维度数、数据集大小或隐藏层中的神经元数量并不能使问题变得简单。最后,我们针对固定数据集大小的两层网络上的 D-NNT 提出了一种伪多项式算法。
引用
@article{arxiv.2412.13057,
title = {On the Hardness of Training Deep Neural Networks Discretely},
author = {Ilan Doron-Arad},
journal= {arXiv preprint arXiv:2412.13057},
year = {2024}
}
备注
Accepted to AAAI 2025