深度特征分布的可迁移扰动
机器学习
2020-04-28 v1 机器学习
摘要
几乎所有当前的 CNN 分类器对抗攻击都依赖于从网络输出层导出的信息。本工作提出一种基于类间与层间深度特征分布建模与利用的新对抗攻击。我们在无防御的 ImageNet 模型上取得了最先进的定向黑盒基于迁移的攻击结果。此外,我们优先考量攻击过程的可解释性与可解读性。我们的方法使得分析对抗攻击如何改变 CNN 的中间特征分布成为可能,并提供了层间与类间特征分布可分离性/纠缠性的度量。我们还概念化了 CNN 架构中从任务/数据特定到模型特定特征的转变,其直接影响对抗样本的迁移性。
引用
@article{arxiv.2004.12519,
title = {Transferable Perturbations of Deep Feature Distributions},
author = {Nathan Inkawhich and Kevin J Liang and Lawrence Carin and Yiran Chen},
journal= {arXiv preprint arXiv:2004.12519},
year = {2020}
}
备注
Published as a conference paper at ICLR 2020