探索神经网络损失景观的几何与拓扑
机器学习
2022-01-28 v2 机器学习
摘要
近期工作已确立训练后神经网络的泛化性能与其所收敛局部极小值附近损失景观几何之间的明确联系。这表明对损失景观几何的定性与定量考察可在训练期间揭示神经网络泛化性能的洞见。为此,研究者提出通过使用简单降维技术可视化损失景观。然而,此类可视化方法受限于其线性本质,且仅捕捉一维或二维特征,从而将损失景观采样限制于直线或平面。此处,我们从三方面拓展并改进这些方法。首先,我们提出一种新颖的“跳跃并重训”过程以采样损失景观的相关部分。我们表明所得采样数据蕴含关于网络泛化能力的更有意义信息。接着,我们展示通过 PHATE(一种保持轨迹与流形的方法)对跳跃并重训轨迹进行非线性降维,可让我们可视化泛化良好与不良网络间的差异。最后,我们将 PHATE 轨迹与计算同调表征结合以量化轨迹差异。
引用
@article{arxiv.2102.00485,
title = {Exploring the Geometry and Topology of Neural Network Loss Landscapes},
author = {Stefan Horoi and Jessie Huang and Bastian Rieck and Guillaume Lajoie and Guy Wolf and Smita Krishnaswamy},
journal= {arXiv preprint arXiv:2102.00485},
year = {2022}
}
备注
Accepted at the 20th Symposium on Intelligent Data Analysis (IDA) 2022