中文

基于对抗性时空聚焦的视频高效鲁棒性评估

计算机视觉与模式识别 2023-03-28 v2 机器学习

摘要

由于视频识别模型在安全关键任务上的广泛应用,其对抗鲁棒性评估已引发关注。与图像相比,视频维度高得多,这在生成对抗视频时带来巨大计算成本。这对于基于查询的黑盒攻击尤为严重,其通常利用对威胁模型的梯度估计,而高维度将导致大量查询。为缓解此问题,我们提出同时消除视频中的时间与空间冗余,以在缩减的搜索空间上实现有效且高效的梯度估计,从而减少查询次数。为实现该想法,我们设计了新颖的对抗性时空聚焦(AstFocus)视频攻击,其对视频帧间与帧内同时聚焦的关键帧与关键区域进行攻击。AstFocus 攻击基于协作式多智能体强化学习(MARL)框架。一个智能体负责选择关键帧,另一智能体负责选择关键区域。这两个智能体通过从黑盒威胁模型接收的共同奖励联合训练以执行协作预测。通过持续查询,由关键帧与关键区域组成的缩减搜索空间变得精确,整体查询次数少于原始视频上的查询次数。在四个主流视频识别模型与三个广泛使用的动作识别数据集上的大量实验表明,所提出的 AstFocus 攻击优于 SOTA 方法,在欺骗率、查询次数、时间与扰动幅度上同时占优。

关键词

引用

@article{arxiv.2301.00896,
  title  = {Efficient Robustness Assessment via Adversarial Spatial-Temporal Focus on Videos},
  author = {Wei Xingxing and Wang Songping and Yan Huanqian},
  journal= {arXiv preprint arXiv:2301.00896},
  year   = {2023}
}

备注

accepted by TPAMI2023