SilentStriker:面向大语言模型的隐形比特翻转攻击
密码学与安全
2025-09-24 v2 机器学习
摘要
大语言模型(LLM)的快速普及促使广泛关注其安全问题。虽然输入操纵攻击(如提示注入)已受到充分研究,但比特翻转攻击(BFA)——利用硬件漏洞破坏模型参数导致严重性能下降——受到的关注有限。现有BFA方法存在关键局限:难以平衡性能下降与输出自然性,容易被发现。本文引入SilentStriker,首个针对LLM的隐形比特翻转攻击,有效降低任务性能同时保持输出自然性。我们的核心贡献在于解决设计针对LLM可变输出长度和广阔输出空间的有效损失函数的挑战。不同于依赖输出囊惑度(perplexity)构建攻击损失函数的先前方法,这会不可避免地降低输出自然性,我们重新构建攻击目标,利用关键输出标记作为抑制目标,实现攻击效果与隐形性的有效联合优化。此外,我们采用迭代、渐进式搜索策略以最大化攻击效能。实验表明,SilentStriker显著优于现有基线,能够在不损害生成文本自然性的前提下成功实施攻击。
引用
@article{arxiv.2509.17371,
title = {SilentStriker:Toward Stealthy Bit-Flip Attacks on Large Language Models},
author = {Haotian Xu and Qingsong Peng and Jie Shi and Huadi Zheng and Yu Li and Cheng Zhuo},
journal= {arXiv preprint arXiv:2509.17371},
year = {2025}
}