ReToMe-VA:基于视频扩散的递归标记合并无限制对抗攻击
计算机视觉与模式识别
2024-08-13 v1
摘要
最近的扩散式无限制攻击生成的对抗样本在感知性和迁移性方面均优于以往的无限制攻击和受限攻击。然而,现有关于扩散式无限制攻击的工作大多关注图像,却很少涉及视频。本文提出了递归标记合并用于视频扩散无限制对抗攻击(ReToMe-VA),这是第一个生成不可感知且具有更高迁移性对抗视频剪辑的框架。具体而言,为实现空间不可感知性,ReToMe-VA采用时间步优化的对抗潜在优化(TALO)策略,在扩散模型的每个去噪步骤中优化扰动。TALO提供了迭代和准确的更新,以生成更有力的对抗帧。TALO还可以进一步减少梯度计算的内存消耗。此外,为实现时间不可感知性,ReToMe-VA引入了递归标记合并(ReToMe)机制,通过在自注意力模块中跨视频帧匹配和合并标记,生成具有时序一致性的对抗视频。ReToMe同时促进了攻击过程中帧间相互作用,诱导更具多样性和鲁棒性的梯度,从而导致更好的对抗迁移性。广泛的实验表明,ReToMe-VA的有效性尤为突出,在对抗迁移性方面超过了最先进的攻击方法平均超过14.16%。
引用
@article{arxiv.2408.05479,
title = {ReToMe-VA: Recursive Token Merging for Video Diffusion-based Unrestricted Adversarial Attack},
author = {Ziyi Gao and Kai Chen and Zhipeng Wei and Tingshu Mou and Jingjing Chen and Zhiyu Tan and Hao Li and Yu-Gang Jiang},
journal= {arXiv preprint arXiv:2408.05479},
year = {2024}
}