GenBFA:面向大语言模型比特翻转攻击的进化优化方法
密码学与安全
2025-07-03 v4 人工智能
机器学习
摘要
大语言模型(LLM)彻底改变了自然语言处理(NLP),在文本生成和摘要等任务中表现出色。然而,它们在关键任务应用中的日益普及引发了基于硬件的威胁,特别是比特翻转攻击(BFA)。BFA通过Rowhammer等故障注入方法,针对内存中的模型参数,损害完整性和性能。在LLM庞大的参数空间中识别关键参数进行BFA面临重大挑战。虽然先前的研究表明,与传统的深度神经网络相比,基于Transformer的架构本质上对BFA更具鲁棒性,但我们挑战了这一假设。我们首次证明,仅需三次比特翻转就能导致拥有数十亿参数的LLM出现灾难性的性能下降。当前的BFA技术由于难以在巨大的参数空间中高效识别关键参数,不足以利用这一漏洞。为此,我们提出了AttentionBreaker,一个专为LLM设计的新框架,能够高效遍历参数空间以识别关键参数。此外,我们引入了GenBFA,一种进化优化策略,旨在进一步细化搜索,隔离最关键的比特以实现高效且有效的攻击。实证结果揭示了LLM对AttentionBreaker的深刻脆弱性。例如,在LLaMA3-8B-Instruct 8位量化(W8)模型中,仅三次比特翻转(占总参数的4.129×10^{-9}%)就导致性能完全崩溃:MMLU任务上的准确率从67.3%降至0%,Wikitext困惑度从12.6飙升至4.72×10^5。这些发现强调了AttentionBreaker在发现和利用LLM架构中关键漏洞方面的有效性。
引用
@article{arxiv.2411.13757,
title = {GenBFA: An Evolutionary Optimization Approach to Bit-Flip Attacks on LLMs},
author = {Sanjay Das and Swastik Bhattacharya and Souvik Kundu and Shamik Kundu and Anand Menon and Arnab Raha and Kanad Basu},
journal= {arXiv preprint arXiv:2411.13757},
year = {2025}
}