重量衰减在Grokking Transformer中的不同 regime:低成本在线诊断
摘要
在模块算术上训练的 Transformer exhibits 记忆、泛化与崩溃之间的尖锐转变。我们表明权重衰减作为一种经验控制参数,用于控制这些 regime,並引入两种低成本在线诊断方法:平均两两注意力头余弦相似性和熵标准差,这些方法仅从注意力激活中跟踪训练动力学,补充了低计算成本下的损失景观诊断。在十一个实验条件和三个模型规模(0.82M 到 85M 参数)中,权重衰减轴分离了记忆、发展Grokking 和崩溃。近似 logistic 拟合在 (95% 置信区间 [0.0109, 0.0200],N=210)处定位记忆到发展之间的边界;幂律拟合给出经验指数 (置信区间 [0.725, 0.799])。参考指数 和 3D Ising 在我们的四 bin 网格下位于该经验置信区间之外,因此我们报告 为经验值,暂且推迟 universality class 识别至更稠密的有限大小标度工作。一个与 horizon 匹配的多任务复制(n=280,四种模块运算)保留了权重衰减控制模式;在 处进行的成对注意力头重新初始化实验改变了 Phase-2 �幅(Cohen's ,n=10,),而匹配的权重范数剪裁则未产生影响。三个跨架构探针(4L MLP、4L LSTM 和 4L Mamba;每个 n=70)复制了权重衰减控制的转变,并具有特定于架构的 值。主要诊断声明限于小型 Transformer 注意力模型中的模块算术;非注意力实验为探针范围,架构-wide、语言模型和 universality class 声明均不在范围内。
引用
@article{arxiv.2605.20441,
title = {Weight Decay Regimes in Grokking Transformers: Cheap Online Diagnostics},
author = {Lucky Verma},
journal= {arXiv preprint arXiv:2605.20441},
year = {2026}
}
备注
28 pages, 11 figures, 5 tables. Code and aggregate JSONs: https://github.com/lucky-verma/grokking-diagnostics. Per-run JSONs: https://huggingface.co/datasets/lucky-verma/grokking-diagnostics-runs. Lean 4/mathlib v4.29.0 formal checks available in the code repository