中文

开放大语言模型中的最大激活值测量

计算与语言 2026-05-18 v1

摘要

激活值的动态范围是低比特量化、激活值缩放和稳定 LLM 推理的一阶约束。先前的工作表征了 2024 年前 LLaMA 风格模型中的异常特征和巨大激活值,而下游的激活-量化技术栈继承了这一图景,并未针对后 LLaMA 时代的开放模型热潮进行重新审视。我们提出了一个面向部署的问题:在现代开放 LLM 中,激活值能变得多大?这种量级在不同模型家族、代际和训练阶段之间如何变化?在统一的流程下(5000 样本的多领域语料库、家族特定的分词、在嵌入层、隐藏状态、注意力、MLP/MoE、SwiGLU 门控和最终层归一化上使用相同的钩子),我们测量了来自 8 个开放家族的 27 个检查点的全局和逐层最大值,这些检查点涵盖了密集模型、MoE、视觉-语言、中间训练和指令微调变体。我们发现:(i) 在可比的参数量下,全局最大值跨越了近四个数量级,其中 Qwen3.5 和 MoE 检查点的范围在 10^2 到 10^3 之间,而 Gemma3-27B-it 达到了约 7 x 10^5;(ii) 跨家族和跨代际的比较打破了简单的单调缩放规律;(iii) MoE 检查点展现出的峰值比同等规模的密集模型低 14.0-23.4 倍,而残差流在 22/24 个检查点中承载了全局最大值。一个轻量级的 INT-8 健全性检查表明,测量到的最大值通过激活值缩放选择与低比特重建误差共变。我们得出结论:最大激活值量级是一个与模型家族、架构和训练阶段相关的属性,而非规模的简单副产品,并且应在任何开放权重发布时,在低比特部署之前进行测量和报告。代码已公开于 https://github.com/clx1415926/Max_act_llm。

关键词

引用

@article{arxiv.2605.15572,
  title  = {Measuring Maximum Activations in Open Large Language Models},
  author = {Luxuan Chen and Han Tian and Xinran Chen and Rui Kong and Fang Wang and Jiamin Chen and Yuchen Li and Jiashu Zhao and Shuaiqiang Wang and Haoyi Xiong and Dawei Yin},
  journal= {arXiv preprint arXiv:2605.15572},
  year   = {2026}
}