学习稀疏特征可能导致神经网络过拟合
机器学习
2022-10-13 v2 机器学习
摘要
人们普遍认为深度网络的成功在于其学习数据特征有意义表示的能力。然而,理解特征学习何时以及如何提升性能仍是一项挑战:例如,对训练用于图像分类的现代架构它是有益的,而对在相同数据上训练用于同一任务的全连接网络则是有害的。本文针对这一谜题提出一种解释,通过表明特征学习可能比惰性训练(经由随机特征核或 NTK)表现更差,因为前者会导致更稀疏的神经网络表示。尽管稀疏性已知对学习各向异性数据至关重要,但当目标函数沿输入空间的某些方向为常数或平滑时,它是有害的。我们在两种设定中阐释该现象:(i) d 维单位球上高斯随机函数的回归,以及 (ii) 图像基准数据集的分类。对于 (i),我们计算了泛化误差随训练点数的标度,并表明不学习特征的方法泛化更好,即便输入空间维数很大。对于 (ii),我们从经验上表明特征学习确实可导致图像预测子的稀疏且因此不够平滑的表示。这一事实或许是导致性能恶化的原因,而已知性能恶化与沿微分同胚的平滑性相关。
引用
@article{arxiv.2206.12314,
title = {Learning sparse features can lead to overfitting in neural networks},
author = {Leonardo Petrini and Francesco Cagnetta and Eric Vanden-Eijnden and Matthieu Wyart},
journal= {arXiv preprint arXiv:2206.12314},
year = {2022}
}