利用异常注入扩大 LLM 量化间隙
机器学习
2026-05-15 v1 人工智能
摘要
LLM 量化已成为内存高效部署的必需品。最近的工作表明,量化方案可能构成严重的安全风险:对手可能发布一个在全精度下看似无害但一旦被用户量化后就 exhibits 恶意行为的模型。然而,现有的量化条件攻击仅限于相对简单的量化方法,其中攻击者可以估计在目标量化下保持不变的权重区域。显著的是,先前的攻击一直未能突破较流行且更复杂的量化方案,限制了其实际影响。在本工作中,我们引入了首个能够针对广泛的先进量化技术(包括 AWQ、GPTQ 和 GGUF I-quants)持续诱导恶意行为的量化条件攻击。我们的攻击利用许多现代量化方法共享的简单属性:大量异常会导致其他权重被四舍五入为零。因此,通过在特定权重块中注入异常,对手可以因此诱导模型中发生针对性且可预测的权重坍缩。这可用于制造看似无害的全精度模型,在量化后 exhibits 广泛的恶意行为。通过在三个攻击情景和 LLMs 上进行大规模评估,我们表明该攻击在先前攻击失败的广泛量化方法上实现了高成功率。我们的结果首次表明,量化的安全风险不仅限于简单方案,而是广泛适用于复杂且广泛使用的量化方法。
引用
@article{arxiv.2605.15152,
title = {Widening the Gap: Exploiting LLM Quantization via Outlier Injection},
author = {Xiaohua Zhan and Kazuki Egashira and Robin Staab and Mark Vero and Martin Vechev},
journal= {arXiv preprint arXiv:2605.15152},
year = {2026}
}