VidDoS:面向视频基大语言模型的通用拒绝服务攻击
计算机视觉与模式识别
2026-03-03 v1 人工智能
摘要
视频基大语言模型 (Video-LLMs) 正在增多部署于安全关键应用中,但易受能耗-延迟攻击 (ELAs) 威胁,这类攻击耗尽计算资源。当前以图像为中心的方法无法奏效,因为时间聚合机制会稀释单个帧扰动。此外,实时需求使得为连续视频流进行逐实例优化难以实现。我们引入 VidDoS,是首个为 Video-LLMs 量身定制的通用 ELAs 框架。我们的方法利用通用优化创建实例无关的触发器,无需推理时梯度计算。我们通过 引导模型走向高成本目标序列,结合 和 以覆盖简洁性先验。测试于三主流 Video-LLMs 和三个视频数据集(包括视频问答和自动驾驶场景),显示极端性能下降。VidDoS 导致 token 扩展超过 205,推理延迟相对于干净基准增加超过 15。对真实时自动驾驶流的仿真进一步揭示,此 induced 延迟导致关键安全违规。我们呼吁社区认识并减轻 Video-LLMs 中的高危 ELAs。
引用
@article{arxiv.2603.01454,
title = {VidDoS: Universal Denial-of-Service Attack on Video-based Large Language Models},
author = {Duoxun Tang and Dasen Dai and Jiyao Wang and Xiao Yang and Jianyu Wang and Siqi Cai},
journal= {arXiv preprint arXiv:2603.01454},
year = {2026}
}