中文

挖掘 LLM 量化技术

机器学习 2024-11-05 v2 人工智能 密码学与安全

摘要

量化通过使用低精度权重来减少大型语言模型(LLM)的内存使用,是使其在一般硬件上部署的关键技术。虽然 LLM 量化对实用性的影响已被广泛探索,但本工作首次从安全角度研究其不利影响。我们揭示了广泛使用的量化方法可被利用以产生有害的量化 LLM,即使其全精度对应版本看起来似乎是良性的,也可能欺骗用户在其设备上部署此类恶意模型。我们使用一个三阶段攻击框架来演示此威胁:(i)首先,通过在对抗任务上进行微调获得恶意 LLM;(ii)接着,对恶意模型进行量化并计算刻画所有映射到相同量化模型的全精度模型的约束;(iii)最后,使用投射梯度下降法从全精度模型中调出毒性行为,同时确保其权重满足步骤 (ii) 中计算的约束。此程序结果是一个在全精度下表现为良性行为的 LLM,但在量化后遵循步骤 (i) 中注入的对抗行为的模型。我们在三个多样化场景中实验演示了此攻击的可行性和严重性:脆弱代码生成、内容注入和过度拒绝攻击。实际情况下,攻击者可以在 LLM 社区如 Hugging Face 等平台上托管所得的全精度模型,将数百万用户暴露于部署其恶意量化版本的威胁之下。

引用

@article{arxiv.2405.18137,
  title  = {Exploiting LLM Quantization},
  author = {Kazuki Egashira and Mark Vero and Robin Staab and Jingxuan He and Martin Vechev},
  journal= {arXiv preprint arXiv:2405.18137},
  year   = {2024}
}