从信号退化到计算崩溃:揭示 LLM 量化的两种失效模式
计算与语言
2026-04-23 v1 人工智能
机器学习
摘要
训练后量化(PTQ)对于大型语言模型(LLM)的高效部署至关重要。虽然 4-bit 量化被广泛认为是最佳的权衡,但将精度降低至 2-bit 通常会引发灾难性的“性能悬崖”。目前尚不清楚其底层机制是否存在根本差异。因此,我们进行了系统的机制分析,揭示了两种在性质上截然不同的失效模式:信号退化,即计算模式保持完整,但信息精度因累积误差而受损;以及计算崩溃,即关键组件失效,无法正确处理信息并在早期层中破坏了信号。在此诊断的指导下,我们进行了机制感知干预,表明有针对性的、无需训练的修复可以缓解信号退化,但对计算崩溃仍然无效。我们的发现为 PTQ 失效提供了系统的诊断框架,并表明解决计算崩溃需要结构重构而非仅仅进行补偿。
引用
@article{arxiv.2604.19884,
title = {From Signal Degradation to Computation Collapse: Uncovering the Two Failure Modes of LLM Quantization},
author = {Chenxi Zhou and Pengfei Cao and Jiang Li and Bohan Yu and Jinyu Ye and Jun Zhao and Kang Liu},
journal= {arXiv preprint arXiv:2604.19884},
year = {2026}
}
备注
Accepted to Findings of ACL 2026