LLM 安全措施是双刃剑:利用误报进行拒绝服务攻击
密码学与安全
2025-04-10 v3 人工智能
摘要
在开放部署中,大语言模型(LLM)的安全性是首要关切,这推动了开发通过安全对齐或警戒机制执行伦理和负责任使用的安全措施。虽然已有针对安全措施中漏检(false negatives)的越狱攻击成为 LLM 安全领域的重要研究方向,但我们发现恶意攻击者也可能利用安全措施的误报(false positives),即欺骗安全模型误拦截安全内容,从而导致对 LLM 用户的拒绝服务(DoS)攻击。为填补这一被忽视威胁的认知鸿沟,我们探索了多种攻击方法,包括注入短暂的对抗性提示到用户提示模板中,以及通过中毒微调破坏服务器上的 LLM。在这两种方式下,攻击都会触发来自客户端的用户请求的安全拒绝。我们的评估表明,这一威胁在多个场景下都具有严重性。例如,在白盒对抗性提示注入场景中,攻击者可通过我们的优化过程自动生成仅约30个字符长的看似安全的对抗性提示,普遍性地阻止 Llama Guard 3 上超过97%的用户请求。这一发现揭示了 LLM 安全评估中的一个新维度——对误报的对抗鲁棒性。
引用
@article{arxiv.2410.02916,
title = {LLM Safeguard is a Double-Edged Sword: Exploiting False Positives for Denial-of-Service Attacks},
author = {Qingzhao Zhang and Ziyang Xiong and Z. Morley Mao},
journal= {arXiv preprint arXiv:2410.02916},
year = {2025}
}