在哪里以及如何攻击?一种受因果启发生成反事实对抗样本的方案
机器学习
2024-01-29 v2
摘要
深度神经网络 (DNNs) 已被证明易受精心制作的\emph{对抗样本}的攻击,这些样本是通过精心设计的 -范数受限或无限制攻击生成的。然而,大多数此类方法假设攻击者可以随意修改任何特征,而忽略了数据的因果生成过程,这是不合理且不切实际的。例如,在银行系统中,收入的修改不可避免地会影响债务收入比等特征。通过考虑被低估的因果生成过程,首先,我们透过因果透镜 pinpoint DNNs 脆弱性的来源,然后给出理论结果来回答\emph{在哪里攻击}。其次,考虑到攻击干预对样本当前状态的后果以生成更真实的对抗样本,我们提出了 CADE,一个能够生成\textbf{C}ounterfactual \textbf{AD}versarial \textbf{E}xamples(反事实对抗样本)的框架,以回答\emph{如何攻击}。实证结果证明了 CADE 的有效性,其在包括白盒、基于迁移和随机干预攻击在内的多种攻击场景中均表现出具有竞争力的性能。
引用
@article{arxiv.2312.13628,
title = {Where and How to Attack? A Causality-Inspired Recipe for Generating Counterfactual Adversarial Examples},
author = {Ruichu Cai and Yuxuan Zhu and Jie Qiao and Zefeng Liang and Furui Liu and Zhifeng Hao},
journal= {arXiv preprint arXiv:2312.13628},
year = {2024}
}
备注
Accepted by AAAI-2024