中文

更少的权重,更多的问题:对 LLM 剪枝的实用攻击

机器学习 2026-04-07 v3 人工智能 密码学与安全

摘要

模型剪枝,即删除模型权重的子集,已成为减少大型语言模型 (LLM) 在推理期间内存占用的流行方法。值得注意的是,诸如 vLLM 等流行推理引擎可让用户在部署前对下载的模型进行便捷剪枝。尽管剪枝方法的实用性和效率有所提高,但剪枝的安全影响仍未得到充分探讨。本文首次展示,现代 LLM 剪枝方法可被恶意利用。具体而言,攻击者可以构建一个看似良性的模型,但一旦被剪枝后,便会表现出恶意行为。我们的 метод基于这样一种想法:攻击者可以计算一个代理指标,用于估计每个参数被剪枝的可能性。借助此信息,攻击者首先可将恶意行为注入那些不太可能被剪枝的参数中。然后,通过使用可能被剪枝的参数来修复模型,从而有效地在未剪枝的模型中抵消注入的行为。我们通过在五个模型上进行大量评估显示,无论应用 vLLM 中的哪种剪枝方法 (Magnitude、Wanda 和 SparseGPT),都能在多样化的攻击场景中始终表现出强大的恶意行为(针对越狱成功率最高可达 95.7%,针对善意指令拒绝成功率最高可达 98.7%,针对定向内容注入成功率最高可达 99.5%)。我们的结果揭示了一个关键的部署时安全缺口,凸显了在模型压缩中加强安全意识的紧迫需求。

关键词

引用

@article{arxiv.2510.07985,
  title  = {Fewer Weights, More Problems: A Practical Attack on LLM Pruning},
  author = {Kazuki Egashira and Robin Staab and Thibaud Gloaguen and Mark Vero and Martin Vechev},
  journal= {arXiv preprint arXiv:2510.07985},
  year   = {2026}
}

备注

ICLR 2026. Code: https://github.com/eth-sri/llm-pruning-attack