神经网络中的内禀维度、持续同调与泛化
机器学习
2021-11-29 v1 人工智能
计算机视觉与模式识别
一般拓扑
机器学习
摘要
现代深度神经网络违背了统计学习理论的经典认知,即使通常包含数百万参数仍能良好泛化。近来研究表明,迭代优化算法的轨迹可能具有分形结构,其泛化误差可与该分形的复杂度形式化关联。此复杂度由分形的内禀维度度量,该量通常远小于网络参数数量。尽管这一视角解释了为何过参数化网络不会过拟合,但计算内禀维度(例如训练期间监测泛化)是众所周知的难题,现有方法即便在中等 ambient 维度下也通常失效。本研究从拓扑数据分析(TDA)的视角考察该问题,并开发了基于严格数学基础的通用计算工具。通过学习理论与 TDA 的新颖联系,我们首先说明泛化误差可等价地由称为“持续同调维度”(PHD)的概念界定,与先前工作相比,我们的方法无需对训练动态作任何额外的几何或统计假设。进而,利用近期确立的理论结果与 TDA 工具,我们开发了在现代深度神经网络规模上估计 PHD 的高效算法,并进一步提供可视化工具以帮助理解深度学习中的泛化。实验表明,所提方法能在多种设置下高效计算网络的内禀维度,并可预测泛化误差。
引用
@article{arxiv.2111.13171,
title = {Intrinsic Dimension, Persistent Homology and Generalization in Neural Networks},
author = {Tolga Birdal and Aaron Lou and Leonidas Guibas and Umut Şimşekli},
journal= {arXiv preprint arXiv:2111.13171},
year = {2021}
}
备注
Appears at NeurIPS 2021