中文

利用基于特征的新颖异常检测识别神经网络后门

机器学习 2023-02-24 v1

摘要

本文提出一种针对神经网络后门攻击的新防御方法,此类攻击在存在攻击者选定触发器的情形下被恶意训练以产生错误预测。我们的防御基于如下直觉:后门网络的特征提取层会嵌入新特征以检测触发器的存在,而随后的分类层学会在检测到触发器时给出错误预测。因此,为检测后门,所提防御使用两个在干净验证数据上训练的协同异常检测器:第一个是检测异常特征的新颖性检测器,第二个则通过与一个在验证数据上训练的独立分类器比较来检测从特征到输出的异常映射。该方法在多种触发器变体的广泛后门网络上进行了评估,这些网络成功规避了最先进的防御。此外,我们评估了该方法在不可感知扰动下的鲁棒性、在大规模数据集上的可扩展性,以及域偏移下的有效性。本文还表明,利用数据增强可进一步提升该防御。

关键词

引用

@article{arxiv.2011.02526,
  title  = {Detecting Backdoors in Neural Networks Using Novel Feature-Based Anomaly Detection},
  author = {Hao Fu and Akshaj Kumar Veldanda and Prashanth Krishnamurthy and Siddharth Garg and Farshad Khorrami},
  journal= {arXiv preprint arXiv:2011.02526},
  year   = {2023}
}