中文

为什么某些输入会破坏低比特LLM量化?

机器学习 2025-09-25 v2 人工智能

摘要

低比特仅权重量化显著降低了大语言模型(LLM)的内存占用,但对某些样本产生了不成比例的影响。我们分析了LLM在7B到70B规模上的多种3-4位方法,发现50对方法的量化误差在FineWeb样本上高度相关(平均0.82)。此外,全精度模型的残差流大小预示着未来的量化误差。我们进一步建立了一个假设,将残差流大小与跨层的误差放大和累积联系起来。利用LLM定位技术、提前退出和激活修补,我们表明误差较大的样本依赖后期层中的精确残差激活,而MLP门控的输出在维持困惑度方面发挥关键作用。我们的工作揭示了为什么某些样本会产生大量量化误差,以及哪些模型组件对性能保持最为关键。

关键词

引用

@article{arxiv.2506.12044,
  title  = {Why Do Some Inputs Break Low-Bit LLM Quantization?},
  author = {Ting-Yun Chang and Muru Zhang and Jesse Thomason and Robin Jia},
  journal= {arXiv preprint arXiv:2506.12044},
  year   = {2025}
}

备注

EMNLP 2025