隐形之手:面向LLM的灰箱位翻转攻击
密码学与安全
2026-04-28 v2
摘要
近年来,大语言模型 (LLM) 取得了显著进展,并在各个领域的关键应用中不断部署。这一增长的采用引发了对其安全性和鲁棒性的紧迫关注。本文调查了位翻转攻击 (BFA) 对 LLM 的影响,这些攻击利用硬件故障破坏模型参数,从而威胁模型的完整性和性能。现有的 BFA 研究主要假设在白盒设置下获取模型权重和部分数据集,并依赖于渐进式基于梯度的位搜索策略来识别模型权重中脆弱的位。然而,针对 LLM 的梯度计算计算昂贵且内存密集。此外,假设获取确切的受害模型权重和数据集在日益严格的用户隐私法规下具有挑战性。为解决这些挑战,我们提出面向 LLM 的首个灰箱 BFA 框架,命名为 Invisible Hands,旨在实现高效和实际的部署。我们的方法,Gradient-Data-Free-BFA,不需要模型权重、梯度或样本数据的知识,即可识别脆弱权重位。它引入了 novel vulnerability index 指标,仅基于模型架构 (灰盒) 估计权重的易受性。通过消除数据访问和梯度计算,我们的方法显著降低了内存开销,并在常数复杂度下高效扩展到各种任务。六个开源 LLM 的实验表明,可仅通过最小权重扰动即可实现对抗目标,凸显了 Invisible Hands 的有效性和实际性。
引用
@article{arxiv.2511.22700,
title = {Invisible Hands: Gray-Box Bit Flip Attack for Steering LLMs Without Knowledge of Gradients, Data, and Weights},
author = {Abeer Matar A. Almalky and Ziyan Wang and Mohaiminul Al Nahian and Li Yang and Adnan Siraj Rakin},
journal= {arXiv preprint arXiv:2511.22700},
year = {2026}
}