你能信任你看到的东西吗?基于 Alpha 通道的视频目标检测无框攻击
计算机视觉与模式识别
2025-10-23 v1 密码学与安全
摘要
随着目标检测模型在自动驾驶车辆 (AV) 和监控平台等类人类系统中的部署,确保其免受对抗威胁的安全性至关重要。虽然先前工作探索了图像域中的对抗攻击,但视频域中的攻击仍大多未被考察,尤其是在无框设置下。本文提出了 α-Cloak,是首个作用于目标检测器的无框对抗攻击,该攻击完全通过 RGBA 视频的 alpha 通道操作。α-Cloak 利用 alpha 通道将恶意目标视频与良性视频融合, resulting in 看似无害的融合视频,但持续欺骗目标检测器。我们的攻击无需访问模型架构、参数或输出,且不引入可感知的伪影。我们系统性地研究了 alpha 通道在常见视频格式和播放应用中的支持情况,并设计融合算法以确保视觉隐形和兼容性。我们在五个最先进的目标检测器、一个视觉-语言模型以及一个多模态大语言模型 (Gemini-2.0-Flash) 上进行评估,证明在所有场景中均实现 100% 的攻击成功率。我们的发现揭示了视频感知系统中此前未被发现的漏洞,凸显了在对抗环境中必须考虑 alpha 通道的紧迫防御需求。
引用
@article{arxiv.2510.19574,
title = {Can You Trust What You See? Alpha Channel No-Box Attacks on Video Object Detection},
author = {Ariana Yi and Ce Zhou and Liyang Xiao and Qiben Yan},
journal= {arXiv preprint arXiv:2510.19574},
year = {2025}
}