方差并非重要性:跨模型规模的Transformer可压缩性结构分析
机器学习
2026-04-23 v1
摘要
我们通过在GPT-2(1.24亿参数)和Mistral 7B(72.4亿参数)上进行的超过40次实验,对Transformer压缩进行了系统的实证研究。我们的分析涵盖了谱压缩、块级函数替换、基于旋转的量化、激活几何和自适应提前退出。我们识别出五个与压缩相关的结构特性。(1)方差并非重要性:高方差激活方向与预测方向(通过CCA测量)约有96%不相关,投影到这些子空间上保留了超过90%的方差,但会降低困惑度。(2)块线性是有条件的:Transformer块仅在正确的上游分布下近似线性(GPT-2上R^2 ~ 0.95,Mistral块31上为0.93);修改较早的块会引起分布偏移,从而降低下游近似的质量。(3)重构墙:将权重分解为量化分量的方法会通过交叉项放大误差,使得直接量化严格更优。(4)线性度随深度增加:Mistral 7B表现出从R^2 = 0.17(块0)到R^2 = 0.93(块31)的进展,表明非线性特征构建和线性细化之间存在分工。(5)大约30%的token在计算上是容易的,这通过退出头和KL散度敏感性得到证实。我们证明,在Mistral 7B的最后一个块上,单块线性替换实现了34倍压缩,困惑度增加1.71,而多块替换由于残差误差累积和分布偏移而失败。这些发现揭示了静态训练后压缩的基本限制,并促使将自适应、逐token计算作为一个更有效的方向。
引用
@article{arxiv.2604.20682,
title = {Variance Is Not Importance: Structural Analysis of Transformer Compressibility Across Model Scales},
author = {Samuel Salfati},
journal= {arXiv preprint arXiv:2604.20682},
year = {2026}
}
备注
18 pages, 10 figures