中文

诊断变换器权重分布的两参数威尔布尔框架

机器学习 2026-05-20 v1

摘要

我们应用威尔布尔分布——一种来自极值理论的两参数分布族——作为变换器元素级权重幅度分布的诊断框架。在初始化时,独立同分布的高斯权重给出 |w| ~ HalfNormal,通过中间 80% 概率图拟合(本工作中使用的协议)得到 k ~ 1.20。这一锚点使 k 成为一种与体系结构无关的训练动态度量标准;在每个层的每个检查点独立拟合每个权力矩阵,使我们能够进行按组件、按层和按步骤的诊断,这些统计聚合无法解决。将此框架应用于跨越 7 个架构族(Pythia、OLMo-1/2、LLaMA-3、Mistral、Qwen2.5/3)的 12 个模型条目,揭示了三个发现。首先,FFN 模块和注意力输出投影 W_o ——即传输类别——落在狭窄的 k 带区间:跨 12 个条目的中间终端 k 在 [1.186, 1.204] 之间(跨族 CV = 0.51%),这一现象在 SwiGLU/GeLU 激活、Pre-LN/QK-Norm 位置以及 70M-14B 规模之间保持一致。其次,注意力输入投影 W_q、W_k ——即选择类别——偏离威尔布尔分布,严重程度受存储方式影响:独立存储的 Q/K(OLMo-1、OLMo-2)yield k 在 [0.76, 0.99](深层);GQA 模型yield k 在 [1.10, 1.16](轻度);Pythia 的合并 W_qkv 处于过渡区,跟踪训练预算 T/tau 单调变化。第三,lambda 在训练期间显著增长,并在 Pythia 族中按 sqrt(eta/lambda_wd) 比例增长(Pearson r = 0.94,三种传输类型),与 Fan 等人(2025)方向一致。两个参数携带独立信息:k 标记功能类别,lambda 标记训练进度。我们发布了 npm-weibull-py v0.4(Python 库)和 DATABASE_v9_1 于 https://github.com/tiexinding/NPM-Weibull-public。

关键词

引用

@article{arxiv.2605.18898,
  title  = {A Two-Parameter Weibull Framework for Diagnosing Transformer Weight Distributions},
  author = {Tiexin Ding},
  journal= {arXiv preprint arXiv:2605.18898},
  year   = {2026}
}

备注

27 pages, 14 figures. Companion library npm-weibull-py and benchmark database available at https://github.com/tiexinding/NPM-Weibull-public