损失条形码:损失地形中可逃逸性的拓扑度量
机器学习
2026-03-04 v3 人工智能
信息论
动力系统
math.IT
摘要
神经网络训练通常基于 SGD。然而,鉴于损失函数的非凸性质以及损失地形复杂的几何特征,对于 SGD 收敛到良好局部极小点的能力,人们的理解仍然有限。在本文中,我们应用拓扑数据分析方法来研究损失地形,以深入理解深度神经网络的学习过程与泛化性质。我们利用损失函数的拓扑结构,将梯度下降轨迹的局部行为与损失曲面的全局性质联系起来。为此,我们借助鲁棒的拓扑不变量——损失函数的条形码(barcodes)——定义了神经网络的拓扑阻碍分数("TO-score"),该分数量化了基于梯度的优化中局部极小点的可逃逸性。我们的两个主要观察是:1)神经网络的损失条形码随深度和宽度的增加而减少,因此学习的拓扑阻碍随之减弱;2)在某些情况下,损失条形码中极小点段的长度与极小点的泛化误差之间存在关联。我们的结论基于对全连接、卷积和 transformer 架构以及包括 MNIST、FMNIST、CIFAR10、CIFAR100、SVHN 和多语言 OSCAR 文本数据集在内的多个数据集的广泛实验。
引用
@article{arxiv.2012.15834,
title = {Loss Barcode: A Topological Measure of Escapability in Loss Landscapes},
author = {Serguei Barannikov and Daria Voronkova and Alexander Mironenko and Ilya Trofimov and Alexander Korotin and Grigorii Sotnikov and Evgeny Burnaev},
journal= {arXiv preprint arXiv:2012.15834},
year = {2026}
}