中文

跨 MLP 和 Transformer 的脉冲临界性

机器学习 2026-04-21 v1 无序系统与神经网络 人工智能 适应与自组织系统

摘要

复杂系统中的离散动力学范畴之间的突变是其显著特征之一。深度神经网络中的“Grokking”现象——即在训练准确率饱和后出现的从记忆向泛化的突变——提供了极具冲击力的例证,但关于这一突变的鲁棒宏观信号仍然尚未发现。本文引入了 **TDU--OFC**(Thresholded Diffusion Update--Olami-Feder-Christensen),一种离线 avalanche 探针,将梯度快照转换为级联统计数据,并通过与 Grokking 对齐的有限-size 比例提取出一个**宏观可观测量**——时间分辨的有效级联维数 D(t)D(t)。在在模块化加法上训练的 Transformer 和在 XOR 上训练的 MLP 中,我们发现 D(t)D(t) 在泛化转变处精确地穿越高斯扩散基线 D=1D=1。这种穿越方向取决于任务:模块化加法向下穿越 D=1D=1(从 D>1D>1 趋近),而 XOR 则向上穿越(从 D<1D<1 趋近)。这种相反的收敛方向与趋向候选共享临界流形的吸引相符,而非简单地接近 D1D \approx 1。负控制实验确认了这一图景:未完成 Grokking 的运行保持超临界(D>1D>1),永远不会进入后转变阶段。此外,avalanche 分布呈现重尾特性且满足有限-size 比例,与从 D(t)D(t) 中提取的维数指数一致。阴影探针控制(αtrain=0\alpha_{\mathrm{train}}=0)确认 D(t)D(t) 为非侵入性的,且完成 Grokking 的轨迹在行为转变前约 100100--200200 个 epoch 中就与未完成 Grokking 的轨迹在 D(t)D(t) 中发生分离。

关键词

引用

@article{arxiv.2604.16431,
  title  = {Dimensional Criticality at Grokking Across MLPs and Transformers},
  author = {Ping Wang},
  journal= {arXiv preprint arXiv:2604.16431},
  year   = {2026}
}