中文

VidDoS:面向视频基大语言模型的通用拒绝服务攻击

计算机视觉与模式识别 2026-03-03 v1 人工智能

摘要

视频基大语言模型 (Video-LLMs) 正在增多部署于安全关键应用中,但易受能耗-延迟攻击 (ELAs) 威胁,这类攻击耗尽计算资源。当前以图像为中心的方法无法奏效,因为时间聚合机制会稀释单个帧扰动。此外,实时需求使得为连续视频流进行逐实例优化难以实现。我们引入 VidDoS,是首个为 Video-LLMs 量身定制的通用 ELAs 框架。我们的方法利用通用优化创建实例无关的触发器,无需推理时梯度计算。我们通过 masked teacher forcing\textit{masked teacher forcing} 引导模型走向高成本目标序列,结合 refusal penalty\textit{refusal penalty}early-termination suppression\textit{early-termination suppression} 以覆盖简洁性先验。测试于三主流 Video-LLMs 和三个视频数据集(包括视频问答和自动驾驶场景),显示极端性能下降。VidDoS 导致 token 扩展超过 205×\times,推理延迟相对于干净基准增加超过 15×\times。对真实时自动驾驶流的仿真进一步揭示,此 induced 延迟导致关键安全违规。我们呼吁社区认识并减轻 Video-LLMs 中的高危 ELAs。

关键词

引用

@article{arxiv.2603.01454,
  title  = {VidDoS: Universal Denial-of-Service Attack on Video-based Large Language Models},
  author = {Duoxun Tang and Dasen Dai and Jiyao Wang and Xiao Yang and Jianyu Wang and Siqi Cai},
  journal= {arXiv preprint arXiv:2603.01454},
  year   = {2026}
}