中文

基于腐蚀鲁棒性一致性的推理阶段后门检测

密码学与安全 2023-04-03 v1 人工智能 机器学习

摘要

深度神经网络被证明易受后门攻击。在推理阶段检测触发样本,即测试时触发样本检测,可防止后门被触发。然而,现有检测方法常要求防御者高度访问受害模型、额外的干净数据或关于后门触发器外观的知识,限制了其实用性。本文提出测试时腐蚀鲁棒性一致性评估(TeCo),一种仅需受害模型的硬标签输出而无需任何额外信息的新型测试时触发样本检测方法。我们的研究始于一个有趣观察:被后门感染的模型对干净图像在不同图像腐蚀下表现相似,而对触发样本表现差异明显。基于该现象,我们设计TeCo,通过计算导致不同腐蚀间预测发生转变的严重性偏差,来评估测试时鲁棒性一致性。大量实验表明,相较于即便需要触发器类型某些信息或干净数据可访问性的最优防御,TeCo在不同后门攻击、数据集和模型架构上均优于它们,AUROC高出10%且稳定性达5倍。

关键词

引用

@article{arxiv.2303.18191,
  title  = {Detecting Backdoors During the Inference Stage Based on Corruption Robustness Consistency},
  author = {Xiaogeng Liu and Minghui Li and Haoyu Wang and Shengshan Hu and Dengpan Ye and Hai Jin and Libing Wu and Chaowei Xiao},
  journal= {arXiv preprint arXiv:2303.18191},
  year   = {2023}
}

备注

Accepted by CVPR2023. Code is available at https://github.com/CGCL-codes/TeCo