中文

神经坍塌动力学:深度、激活、正则化与特征范数阈值

机器学习 2026-04-02 v1

摘要

神经坍塌(NC)——即最终隐层特征收敛于等角紧密帧的单极结构——在平衡态下已被充分理解,但主导其发生动力学的机制仍缺乏系统阐述。我们识别出一种简单且具预测性的规律:NC发生于特征均值范数达到模型-数据特定临界值 fn* 时,这一值对训练条件几乎保持不变。该值在每个 (模型, 数据) 组合内高度集中(CV < 8%);训练动力学主要影响特征范数 fn 接近 fn* 的速度,而非其本身。在标准训练轨迹中,fn 降低至 fn* 以下始终 precedes NC 的发生,提供了平均提前 62 个 epoch(MAE 24 个 epoch)的实用预测器。直接干预实验确认 fn* 是梯度流的稳定吸引子——对特征尺度的扰动在训练期间均得到自我纠正,无论方向如何均收敛至相同值(p>0.2)。完成 (架构)x(数据) 的网格后,发现该论文的最强结果:ResNet-20 在 MNIST 上给出 fn* = 5.867——这一值相对于仅在 CIFAR-10 上的 +68% 的架构效应,体现了 +458% 的架构效应。该网格strongly non-additive(强非可加);fn* 无法分解为独立的架构与数据贡献。四项结构规律浮现:(1)深度对坍塌速度具有非单调效应;(2)激活联合决定坍塌速度与 fn*;(3)权重衰减定义三相相图——过少减缓,最佳区间最快,且过多可防止坍塌;(4)宽度单调加速坍塌同时将 fn* 最多偏移13%。这些结果确立了特征范数动力学为预测 NC 时间的可操作诊断工具,表明范数阈值行为是深层网络延迟表征重组通用机制。

关键词

引用

@article{arxiv.2604.00230,
  title  = {Neural Collapse Dynamics: Depth, Activation, Regularisation, and Feature Norm Threshold},
  author = {Anamika Paul Rupa},
  journal= {arXiv preprint arXiv:2604.00230},
  year   = {2026}
}