PRAT:对抗攻击溯源分析
计算机视觉与模式识别
2023-09-21 v1
摘要
深度学习对对抗样本的内在易感性已催生大量以欺骗深度模型为共同广泛目标的攻击技术。然而,我们发现达成该目标的算法间存在细微构成差异。这些差异留下了重要线索,可为现实场景中的攻击者溯源提供关键信息。受此启发,我们引入一种新问题:对抗攻击溯源分析(PRofiling Adversarial aTtacks, PRAT)。给定一个对抗样本,PRAT 的目标是识别用于生成它的攻击。在此视角下,我们可将现有攻击系统性地归为不同族类,进而导出攻击族识别的子问题,我们也对此进行了研究。为支持 PRAT 分析,我们引入一个大型对抗识别数据集(AID),包含超过 18 万张由 13 种流行攻击在图像特定/无关白盒/黑盒设置下生成的对抗样本。我们利用 AID 设计了一种面向 PRAT 目标的新框架。该框架采用基于 Transformer 的全局-局部特征(GLOF)模块提取对抗攻击的近似签名,并据此用于攻击识别。利用 AID 与我们的框架,我们为 PRAT 问题提供了多项有趣的基准结果。
引用
@article{arxiv.2309.11111,
title = {PRAT: PRofiling Adversarial aTtacks},
author = {Rahul Ambati and Naveed Akhtar and Ajmal Mian and Yogesh Singh Rawat},
journal= {arXiv preprint arXiv:2309.11111},
year = {2023}
}