中文

面向深度学习后门防御措施鲁棒性的批判性评估

密码学与安全 2022-04-14 v1 人工智能

摘要

由于深度学习(DL)后门攻击已被揭示为最阴险的对抗攻击之一,许多防御措施已在各自威胁模型中定义的特定假设下被开发。然而,这些防御措施的鲁棒性被无意中忽视,这可能引入严重后果,例如防御措施可能被误用并导致后门检测的错误暗示。我们首次批判性审视现有后门防御措施的鲁棒性,初步聚焦于三种有影响力的模型检测类方法:Neural Cleanse(S&P'19)、ABS(CCS'19)和MNTD(S&P'21)。尽管这三种防御措施声称在其各自威胁模型下表现良好,它们具有固有的未探索非鲁棒情形,取决于给定任务、模型架构、数据集和防御超参数等因素,这些情形\textit{甚至并非源于精心设计的自适应攻击}。我们展示了如何通过简单改变上述因素,在其各自威胁模型对齐下轻易绕过它们。特别地,对每种防御,我们使用形式化证明或实证研究揭示其两种非鲁棒情形,其中它不如其声称或预期的鲁棒,尤其是近期的MNTD。本工作强调了彻底评估后门防御措施鲁棒性的必要性,以避免其在未知非鲁棒情形中的误导性安全暗示。

关键词

引用

@article{arxiv.2204.06273,
  title  = {Towards A Critical Evaluation of Robustness for Deep Learning Backdoor Countermeasures},
  author = {Huming Qiu and Hua Ma and Zhi Zhang and Alsharif Abuadbba and Wei Kang and Anmin Fu and Yansong Gao},
  journal= {arXiv preprint arXiv:2204.06273},
  year   = {2022}
}