视频的稀疏对抗扰动
计算机视觉与模式识别
2018-03-08 v1
摘要
尽管深度神经网络(DNNs)的对抗样本已在静态图像上被深入研究,但其在视频上的扩展从未被探索。与图像相比,攻击视频不仅需要考虑空间线索,还需考虑时间线索。此外,为提高不可感知性并降低计算成本,扰动应加在尽可能少的帧上,即对抗扰动在时间上是稀疏的。这进一步催生了扰动的传播,即当前帧上添加的扰动可通过其时间交互转移到后续帧。因此,这些帧无需(或仅需极少)额外扰动即可被误分类。为此,我们提出一种基于 l2,1 范数的优化算法来计算视频的稀疏对抗扰动。我们选择动作识别作为目标任务,并以具有 CNN+RNN 架构的网络作为威胁模型来验证我们的方法。得益于传播性,我们可在缩短版视频上计算扰动,再将其适配到长版视频以欺骗 DNNs。在 UCF101 数据集上的实验结果表明,即使视频中仅一帧被扰动,欺骗率仍可达 59.7%。
引用
@article{arxiv.1803.02536,
title = {Sparse Adversarial Perturbations for Videos},
author = {Xingxing Wei and Jun Zhu and Hang Su},
journal= {arXiv preprint arXiv:1803.02536},
year = {2018}
}