中文

基于空间变换域敏感性不一致性的对抗样本检测

机器学习 2021-03-09 v1 密码学与安全 计算机视觉与模式识别

摘要

深度神经网络(DNNs)已被证明易受对抗样本(AEs)攻击,后者被恶意设计以引发剧烈的模型输出错误。本工作中,我们揭示正常样本(NEs)对决策边界高曲率区域发生的波动不敏感,而通常基于单一域(多为空间域)设计的AEs在此类波动上表现出过度敏感性。该现象促使我们设计另一具有变换后决策边界的分类器(称为对偶分类器),其可与原始分类器(称为原始分类器)协作,利用敏感性不一致来检测AEs。与基于局部本征维数(LID)、马氏距离(MD)和特征压缩(FS)的先进算法相比,我们提出的敏感性不一致检测器(SID)实现了改进的AE检测性能和更优的泛化能力,尤其在对抗扰动水平较小的挑战性案例中。基于ResNet和VGG的密集实验结果验证了所提SID的优越性。

关键词

引用

@article{arxiv.2103.04302,
  title  = {Detecting Adversarial Examples from Sensitivity Inconsistency of Spatial-Transform Domain},
  author = {Jinyu Tian and Jiantao Zhou and Yuanman Li and Jia Duan},
  journal= {arXiv preprint arXiv:2103.04302},
  year   = {2021}
}