迈向深度 ReLU 网络内在泛化能力的量化
机器学习
2019-10-22 v1 神经与进化计算
机器学习
摘要
理解使深度神经网络取得经验成功的底层机制,对于进一步提升其性能并解释此类网络至关重要。为此,一个具体问题是:如何解释同一过参数化深度神经网络在真实数据集上能良好泛化、同时在标签随机化时“记忆”训练样本这一“令人惊讶”的行为。本文中,我们证明深度 ReLU 网络通过分段线性插值从训练样本泛化到新点。我们对深度 ReLU 网络的泛化能力提供量化分析:给定固定点 和输入空间 中固定方向,总存在一段线段使得线段上任意点将被分类为与固定点 相同。我们称此线段为 (泛化区间)。我们展示在 MNIST 和 CIFAR-10 数据集上,ReLU 网络在真实与随机情形下沿同标签样本间成对方向的泛化区间表现相似。该结果表明两种情形下使用了相同的插值机制。此外,对于使用真实标签的数据集,此类网络对数据中底层流形提供了良好近似,其中沿切向的变化远小于沿法向的变化。另一方面,对于随机标签数据集,沿同标签三角形中线方向的泛化区间远小于真实标签数据集上的情形,表明沿其他方向行为不同。我们的系统实验首次证明此类深度神经网络通过相同插值泛化,并解释了其在真实与随机标签数据集上性能的差异。
引用
@article{arxiv.1910.08581,
title = {Towards Quantifying Intrinsic Generalization of Deep ReLU Networks},
author = {Shaeke Salman and Canlin Zhang and Xiuwen Liu and Washington Mio},
journal= {arXiv preprint arXiv:1910.08581},
year = {2019}
}
备注
11 pages, 9 figures