通过故障注入攻击对量化语言模型进行越狱
密码学与安全
2025-07-10 v2 人工智能
摘要
语言模型(Language Models, LMs)的安全对齐是关键关注点,但其完整性可能因直接参数操控攻击(如故障注入攻击)而受到挑战。随着低精度量化用于提高效率而逐渐部署语言模型,本文调查此类攻击在不同量化方案下对对齐语言模型的有效性。我们提出了梯度引导的攻击,包括一种贴合的渐进比特级搜索算法(本文引入)和一种比较型的单词级(单次权重更新)攻击。我们在Llama-3.2-3B、Phi-4-mini和Llama-3-8B上进行评估,涵盖FP16(基准)以及权重-only量化(FP8、INT8、INT4)。结果表明,量化显著影响攻击成功率。虽然在FP16模型上,攻击轻易实现高于80%的攻击成功率(Attack Success Rate, ASR),但在攻击预算为25次扰动后,FP8和INT8模型的ASR分别低于20%和50%。增加扰动预算至150位比特翻转后,FP8模型维持ASR低于65%,显示出一定的韧性,而INT8和INT4模型则表现出高ASR。此外,对扰动位置的分析显示,不同量化方案的体系结构目标不同,FP16和INT4;以及INT8和FP8显示出类似特征。此外,FP16模型上引发的越狱对后续FP8/INT8量化高度可移植(<5% ASR差异),但INT4显著降低了可移植ASR(平均35%下降)。这些发现表明,尽管常用量化方案,特别是FP8,增加了直接参数操控越狱的难度,但仍存在漏洞,尤其是在后攻击量化方面。
引用
@article{arxiv.2507.03236,
title = {On Jailbreaking Quantized Language Models Through Fault Injection Attacks},
author = {Noureldin Zahran and Ahmad Tahmasivand and Ihsen Alouani and Khaled Khasawneh and Mohammed E. Fouda},
journal= {arXiv preprint arXiv:2507.03236},
year = {2025}
}
备注
This work has been published in GLSVLSI 2025