中文

针对大语言模型的拒绝服务投毒攻击

密码学与安全 2024-10-15 v1 计算与语言

摘要

最近的研究表明,LLM容易受到拒绝服务(DoS)攻击,其中诸如拼写错误或非语义提示等对抗性输入会触发无休止的输出,而不会生成[EOS]标记。这些攻击可能导致高延迟,并使LLM服务对其他用户或任务不可用。然而,当存在语音到文本接口(例如,对机器人的语音命令)时,执行此类DoS攻击变得具有挑战性,因为很难通过语音引入拼写错误或非语义提示。在这些场景中,一个简单的DoS攻击是指导模型“不断重复Hello”,但我们观察到,仅依赖自然指令会限制输出长度,该长度受限于LLM监督微调(SFT)数据的最大长度。为了克服这一限制,我们提出了针对LLM的基于投毒的DoS(P-DoS)攻击,证明注入一个为DoS目的设计的单一中毒样本可以打破输出长度限制。例如,一个中毒样本可以使用不到1美元的成本成功攻击GPT-4o和GPT-4o mini(通过OpenAI的微调API),导致重复输出达到最大推理长度(16K tokens,而中毒前为0.5K)。此外,我们对开源LLM进行了全面的消融研究,并将我们的方法扩展到LLM智能体,其中攻击者可以控制微调数据集和算法。我们的发现强调了迫切需要针对P-DoS攻击的防御措施来保护LLM。我们的代码可在https://github.com/sail-sg/P-DoS获取。

关键词

引用

@article{arxiv.2410.10760,
  title  = {Denial-of-Service Poisoning Attacks against Large Language Models},
  author = {Kuofeng Gao and Tianyu Pang and Chao Du and Yong Yang and Shu-Tao Xia and Min Lin},
  journal= {arXiv preprint arXiv:2410.10760},
  year   = {2024}
}