AEVA:基于对抗极值分析的黑盒后门检测
机器学习
2022-02-28 v4 人工智能
摘要
深度神经网络(DNN)已被证明易受后门攻击。后门通常通过向训练样本中注入后门触发器而嵌入到目标DNN中,这会导致目标DNN将带有后门触发器的输入误分类。现有的后门检测方法通常需要访问原始投毒训练数据、目标DNN的参数或每个给定输入的分类置信度,这在许多现实应用中是不切实际的,例如设备上部署的DNN。我们解决了黑盒硬标签后门检测问题,其中DNN是完全黑盒的,仅可访问其最终输出标签。我们从优化角度处理该问题,并表明后门检测的目标受一个对抗目标所界定。进一步的理论和实证研究表明,该对抗目标导致一个高度偏斜分布的解;在被后门感染的样本的对抗图中常观察到奇点,我们称之为对抗奇点现象。基于该观察,我们提出对抗极值分析(AEVA)来检测黑盒神经网络中的后门。AEVA基于对抗图的极值分析,该对抗图由蒙特卡洛梯度估计计算。在多个流行任务和后端攻击上的大量实验证明,我们的方法在黑盒硬标签场景下检测后门攻击是有效的。
引用
@article{arxiv.2110.14880,
title = {AEVA: Black-box Backdoor Detection Using Adversarial Extreme Value Analysis},
author = {Junfeng Guo and Ang Li and Cong Liu},
journal= {arXiv preprint arXiv:2110.14880},
year = {2022}
}