VideoPure:基于扩散模型的对抗性视频纯化
计算机视觉与模式识别
2025-01-28 v1
摘要
近期研究表明,视频识别模型易受对抗样本攻击,构成下游应用的严重安全风险。然而,当前研究主要聚焦于对抗攻击,针对防御机制的探索有限。此外,鉴于视频的空间时间复杂性,现有的视频防御方法面临高成本、过拟合和防御性能有限等问题。最近,基于扩散的对抗性纯化方法在图像领域实现了稳健的防御性能。然而,由于视频额外的时序维度,直接将这些基于扩散的对抗性纯化方法应用于视频领域会导致性能和效率下降。为实现高效且有效的视频对抗防御方法,我们提出了首个基于扩散的视频纯化框架以提升视频识别模型的对抗鲁棒性:VideoPure。给定对抗样本,我们首先采用时序 DDIM 反向转换,将输入分布转换为时序一致且轨迹定义的分布,覆盖对抗噪声同时保留更多视频结构。随后,在 DDIM 去噪过程中,我们利用每个去噪步骤的中间结果并进行引导式空间时间优化,在保持时序一致性的同时移除对抗噪声。最后,我们将优化后的中间结果列表输入视频识别模型进行多步骤投票,以获得预测类别。我们针对基准数据集和模型上的黑盒、灰盒和自适应攻击,探讨了该方法的防御性能。与其他对抗性纯化方法相比,我们的方法在不同攻击下整体表现更佳。我们的代码已发布于 https://github.com/deep-kaixun/VideoPure。
引用
@article{arxiv.2501.14999,
title = {VideoPure: Diffusion-based Adversarial Purification for Video Recognition},
author = {Kaixun Jiang and Zhaoyu Chen and Jiyuan Fu and Lingyi Hong and Jinglun Li and Wenqiang Zhang},
journal= {arXiv preprint arXiv:2501.14999},
year = {2025}
}