中文

SBFA:单次隐蔽比特翻转攻击以攻破大语言模型

密码学与安全 2025-09-29 v1 计算与语言 机器学习

摘要

大语言模型(LLM)的模型完整性随着其大规模在线部署已成为紧迫的安全问题。先前的比特翻转攻击(BFAs)——一类流行的AI权重存储故障注入技术——可严重损害深度神经网络(DNNs):仅需数十次比特翻转即可将准确率降级至随机猜测水平。近期研究将BFAs扩展至LLM,揭示出尽管从模块化和冗余性角度直觉上具有更好的鲁棒性,仅少数对抗性比特翻转同样会导致LLM准确率的灾难性降级。然而,现有的BFA方法通常分别关注整数或浮点模型,限制了攻击灵活性。此外,在浮点模型中,随机比特翻转常导致扰动参数达到极端值(例如翻转指数位),使其不够隐蔽并导致数值运行时错误(例如无效张量值NaN/Inf)。在本工作中,我们首次提出SBFA(隐蔽比特翻转攻击),仅通过单次比特翻转即可使LLM性能崩溃,同时将扰动值保持在良性的逐层权重分布范围内。这是通过迭代搜索和排序我们定义的参数敏感性指标ImpactScore实现的,该指标结合了梯度敏感性和由良性逐层权重分布约束的扰动范围。还提出了一种新颖轻量的SKIP搜索算法,大幅降低了搜索复杂度,使得对最先进LLM的SBFA搜索仅需数十分钟。在Qwen、LLaMA和Gemma模型上,仅需单次比特翻转,SBFA即在BF16和INT8数据格式下成功将MMLU和SST-2上的准确率降级至随机水平以下。值得注意的是,翻转数十亿参数中的单个比特揭示了最先进LLM模型的严重安全隐患。

关键词

引用

@article{arxiv.2509.21843,
  title  = {SBFA: Single Sneaky Bit Flip Attack to Break Large Language Models},
  author = {Jingkai Guo and Chaitali Chakrabarti and Deliang Fan},
  journal= {arXiv preprint arXiv:2509.21843},
  year   = {2025}
}

备注

10 pages, 4 figures, 5 tables, 2 equations. Topics: Bit-flip attacks, adversarial attacks, large language models (LLMs)