大语言模型中的超级权重
计算与语言
2025-07-08 v2 人工智能
摘要
近期工作展示了一个惊人结果:大语言模型(LLM)中极小比例的参数异常值对模型质量有着不成比例的重要影响。LLM包含数十亿参数,因此这些小比例(如0.01%)转化为数十万个参数。在本工作中,我们呈现了一个更令人惊讶的发现:仅剪枝一个参数就能破坏LLM生成文本的能力——困惑度增加三个数量级,零样本准确率降至随机猜测水平。我们提出了一种无需数据的方法,通过模型的单次前向传播来识别此类参数,称为超级权重。我们还发现这些超级权重诱导出相应的罕见且巨大的激活异常值,称为超级激活。当以高精度保留时,超级激活可以改进简单的最近舍入量化,使其具有与最先进方法竞争的性能。对于权重量化,我们同样发现:通过保留超级权重并裁剪其他权重异常值,最近舍入量化可以扩展到比之前考虑大得多的块大小。为促进对超级权重的进一步研究,我们提供了常见公开LLM的超级权重坐标索引。
引用
@article{arxiv.2411.07191,
title = {The Super Weight in Large Language Models},
author = {Mengxia Yu and De Wang and Qi Shan and Colorado J Reed and Alvin Wan},
journal= {arXiv preprint arXiv:2411.07191},
year = {2025}
}