Mind the Gap: 针对GGUF量化的实用攻击
密码学与安全
2025-06-05 v3 人工智能
机器学习
摘要
随着前沿 LLM 规模的不断扩大,训练后量化已成为内存高效部署的标准。近期研究表明,基于基本舍入的量化方案存在安全风险,因为攻击者可利用其将恶意行为注入量化模型中,而这些行为在全精度下保持隐藏。然而,现有攻击无法应用于更复杂的量化方法,例如流行的 ollama 和 llamacpp 框架中使用的 GGUF 系列。在本研究中,我们通过引入首个针对 GGUF 的攻击来填补这一空白。我们的核心洞察是,量化误差——即全精度权重与其(反)量化版本之间的差异——提供了足够的灵活性来构造在全精度下看似良性但实为恶意的量化模型。基于此,我们开发了一种攻击方法,在基于量化误差约束权重的同时训练目标恶意 LLM。我们在三种不同的攻击场景下,针对三个流行的 LLM 和九种 GGUF 量化数据类型,展示了我们攻击的有效性:不安全代码生成(=)、定向内容注入(=)和良性指令拒绝(=)。我们的攻击表明:(1)最广泛使用的训练后量化方法容易受到对抗性干扰;(2)仅靠量化方案的复杂性不足以作为防御手段。
引用
@article{arxiv.2505.23786,
title = {Mind the Gap: A Practical Attack on GGUF Quantization},
author = {Kazuki Egashira and Robin Staab and Mark Vero and Jingxuan He and Martin Vechev},
journal= {arXiv preprint arXiv:2505.23786},
year = {2025}
}
备注
ICML 2025