中文

平滑输出假设,以及为何深度网络优于宽度网络

机器学习 2022-11-29 v1

摘要

当若干模型具有相似的训练分数时,经典模型选择启发式遵循奥卡姆剃刀并建议选择容量最小的那些。然而,现代使用大型神经网络的实践经常导致这样的情况:两个参数数量完全相同的网络在训练集上得分相似,但更深的那个对未见样本的泛化更好。鉴于此,人们普遍接受深度网络优于浅而宽的网络。然而,理论上二者并无区别。事实上,它们二者都是通用逼近器。在本工作中,我们提出一种新的无监督度量来预测模型的泛化能力。我们称之为输出锐度(output sharpness),它基于这样一个事实:在现实中,概念之间的边界通常是非锐利的。我们在若干神经网络设置与架构上测试了这一新度量,并展示了我们的度量与测试集性能之间的相关性通常很强。在确立该度量后,我们给出一个数学概率论证,预测网络深度与我们提出的度量相关。在真实数据中验证这一点后,我们得以阐述本工作的关键论点:输出锐度妨碍泛化;深度网络内建了对其的偏置抵制;因此,深度网络击败宽度网络。总而言之,本工作不仅提供了一个有助于实践用于模型选择(甚至正则化)的过拟合预测器,也为现代深度神经网络的成功提供了亟需的理论基础。

关键词

引用

@article{arxiv.2211.14347,
  title  = {The smooth output assumption, and why deep networks are better than wide ones},
  author = {Luis Sa-Couto and Jose Miguel Ramos and Andreas Wichert},
  journal= {arXiv preprint arXiv:2211.14347},
  year   = {2022}
}