多层感知器中的平台、最优解与过拟合:鞍点-鞍点-吸引子场景
机器学习
2026-04-20 v2 适应与自组织系统
摘要
梯度消失与过拟合是机器学习中的核心问题,但通常在渐近 regime 中进行分析,这掩盖了其动力学起源。这里我们通过一个受 Fukumizu 和 Amari 启发的最小模型,为多层感知器(MLP)中的学习提供了动力学描述。我们表明训练动力学在收敛到过拟合 regime 之前,会穿越由鞍点结构组织的平台区域和近最优区域。在数据满足适当条件的情况下,该 regime 在对称性意义下坍缩为单个吸引子。此外,对于有限含噪数据集,收敛至理论最优解是不可能的,动力学必然收敛到过拟合解中。
引用
@article{arxiv.2604.02393,
title = {Plateaus, Optima, and Overfitting in Multi-Layer Perceptrons: A Saddle-Saddle-Attractor Scenario},
author = {Alex Alì Maleknia and Yuzuru Sato},
journal= {arXiv preprint arXiv:2604.02393},
year = {2026}
}