中文

重新思考延迟拒绝服务攻击:针对 LLM 推理框架而非模型的攻击

密码学与安全 2026-02-10 v1 人工智能

摘要

大型语言模型 (LLM) 面临一种新且关键威胁,称为延迟攻击。由于 LLM 推理本质上昂贵,即使轻微减慢也可能转化为巨大的运营成本和严重的可用性风险。最近,越来越多的研究聚焦于通过精心设计输入来触发最坏情况输出长度的算法复杂度攻击。然而,我们报告了一个反直觉发现,这些算法延迟攻击在现代 LLM 推理系统中基本无效。我们揭示了系统层面的优化(如持续批处理)提供了逻辑隔离,以缓解共置用户的传染性延迟影响。为此,我们在本文中将注意力从算法转向系统层面,提出一种新的 Fill and Squeeze 攻击策略,针对调度器的状态转换。Fill 方法首先耗尽全局 KV 缓存以诱发首部阻塞 (Head-of-Line blocking),而 Squeeze 方法则迫使系统进入重复抢占。通过操控输出长度,从简单纯文本提示到更复杂的提示工程,我们演示该攻击可在黑盒环境中以更低成本实施。广泛评估表明,与现有攻击相比,平均 Time to First Token 延迟增加 20-280 倍,Time Per Output Token 延迟增加 1.5-4 倍,且攻击成本降低 30-40%。

关键词

引用

@article{arxiv.2602.07878,
  title  = {Rethinking Latency Denial-of-Service: Attacking the LLM Serving Framework, Not the Model},
  author = {Tianyi Wang and Huawei Fan and Yuanchao Shu and Peng Cheng and Cong Wang},
  journal= {arXiv preprint arXiv:2602.07878},
  year   = {2026}
}