豪斯多夫维数、重尾与神经网络中的泛化
机器学习
2022-01-12 v3 机器学习
摘要
尽管随机梯度下降(SGD)在广泛应用上取得成功,刻画其在非凸深度学习问题中的泛化性质仍是一项重要挑战。近期,在重尾梯度噪声下通过随机微分方程(SDE)对SGD轨迹建模,已阐明SGD若干特殊性质,但在学习理论框架中严格处理此类SDE的泛化性质仍属空白。为弥补该缺口,本文在SGD轨迹可被\emph{Feller过程}良好近似的假设下证明泛化界,Feller过程定义了一类丰富的马尔可夫过程,包含若干近期SDE表示(布朗或重尾)作为其特例。我们表明泛化误差可由轨迹的\emph{豪斯多夫维数}控制,其与驱动过程的尾部行为密切相关。我们的结果意味着重尾过程应取得更好泛化;因此,过程的尾指数可用作一种“容量度量”概念。我们以深度神经网络上的实验支撑理论,表明所提容量度量能准确估计泛化误差,且不同于文献中现有容量度量,其未必随参数数量增长。
引用
@article{arxiv.2006.09313,
title = {Hausdorff Dimension, Heavy Tails, and Generalization in Neural Networks},
author = {Umut Şimşekli and Ozan Sener and George Deligiannidis and Murat A. Erdogdu},
journal= {arXiv preprint arXiv:2006.09313},
year = {2022}
}
备注
Published at NeurIPS 2020 (Spotlight) -- an imprecision in Definition 2 and a mistake in the statement and the proof of Theorem 2 are fixed