神经网络能否外推?兼论 Pedro Domingos 的一个定理
计算机视觉与模式识别
2022-11-08 v1
摘要
通过在大型数据集上最小化损失训练的神经网络已成为解决数据科学问题的最先进方法,尤其在计算机视觉、图像处理和自然语言处理中。尽管其结果令人瞩目,我们对神经网络如何运作的理论理解仍然有限。具体而言,训练好的神经网络具有怎样的插值能力?在本文中,我们讨论 Domingos 的一个定理,其陈述为“每一个通过连续梯度下降学习的机器都近似为一个核机器”。据 Domingos 所言,这一事实导致结论:所有在数据上训练的机器都不过是核机器。我们首先将 Domingos 的结果推广到离散情形以及具有向量值输出的网络。随后我们研究其在简单例子上的相关性与意义。我们发现,在简单情况下,Domingos 定理中出现的“神经正切核”确实提供了对网络预测的理解。此外,当赋予网络的任务复杂度增加时,网络的插值能力可由 Domingos 定理有效解释,因而受到限制。我们在一个经典的感知理论问题上说明了这一事实:从边界恢复形状。
引用
@article{arxiv.2211.03566,
title = {Can neural networks extrapolate? Discussion of a theorem by Pedro Domingos},
author = {Adrien Courtois and Jean-Michel Morel and Pablo Arias},
journal= {arXiv preprint arXiv:2211.03566},
year = {2022}
}