中文

重量衰减在Grokking Transformer中的不同 regime:低成本在线诊断

机器学习 2026-05-21 v1 人工智能 神经与进化计算

摘要

在模块算术上训练的 Transformer exhibits 记忆、泛化与崩溃之间的尖锐转变。我们表明权重衰减作为一种经验控制参数,用于控制这些 regime,並引入两种低成本在线诊断方法:平均两两注意力头余弦相似性和熵标准差,这些方法仅从注意力激活中跟踪训练动力学,补充了低计算成本下的损失景观诊断。在十一个实验条件和三个模型规模(0.82M 到 85M 参数)中,权重衰减轴分离了记忆、发展Grokking 和崩溃。近似 logistic 拟合在 λc=0.0158\lambda_c=0.0158(95% 置信区间 [0.0109, 0.0200],N=210)处定位记忆到发展之间的边界;幂律拟合给出经验指数 ν=0.757\nu=0.757(置信区间 [0.725, 0.799])。参考指数 ν=1/2\nu=1/2 和 3D Ising ν0.63\nu \approx 0.63 在我们的四 bin 网格下位于该经验置信区间之外,因此我们报告 ν\nu 为经验值,暂且推迟 universality class 识别至更稠密的有限大小标度工作。一个与 horizon 匹配的多任务复制(n=280,四种模块运算)保留了权重衰减控制模式;在 λ=0.05\lambda=0.05 处进行的成对注意力头重新初始化实验改变了 Phase-2 �幅(Cohen's d=1.190d=-1.190,n=10,pt=4.5×103p_t=4.5 \times 10^{-3}),而匹配的权重范数剪裁则未产生影响。三个跨架构探针(4L MLP、4L LSTM 和 4L Mamba;每个 n=70)复制了权重衰减控制的转变,并具有特定于架构的 λc\lambda_c 值。主要诊断声明限于小型 Transformer 注意力模型中的模块算术;非注意力实验为探针范围,架构-wide、语言模型和 universality class 声明均不在范围内。

关键词

引用

@article{arxiv.2605.20441,
  title  = {Weight Decay Regimes in Grokking Transformers: Cheap Online Diagnostics},
  author = {Lucky Verma},
  journal= {arXiv preprint arXiv:2605.20441},
  year   = {2026}
}

备注

28 pages, 11 figures, 5 tables. Code and aggregate JSONs: https://github.com/lucky-verma/grokking-diagnostics. Per-run JSONs: https://huggingface.co/datasets/lucky-verma/grokking-diagnostics-runs. Lean 4/mathlib v4.29.0 formal checks available in the code repository