中文

面向黑盒 DNN 后门检测的触发样本与良性特征差异分析

密码学与安全 2023-07-20 v2 机器学习

摘要

本文提出一种数据高效的深度神经网络黑盒场景下抵御后门攻击的检测方法。该方法的动机源于如下直觉:与触发器对应的特征在决定后门网络输出时比其他任何良性特征具有更高的影响。为定量度量触发器与良性特征对决定后门网络输出的影响,我们引入五个度量指标。为计算给定输入的五指标值,我们首先通过将输入的部分内容注入干净验证样本来生成若干合成样本。然后,利用相应合成样本的输出标签计算这五个度量。本工作的一个贡献是使用极小的干净验证数据集。在获得计算出的五指标后,从验证数据集训练五个新颖性检测器。一个元新颖性检测器融合五个已训练新颖性检测器的输出以生成元置信度分数。在在线测试期间,我们的方法通过评估在线样本的元新颖性检测器输出的元置信度分数来判断其是否被毒化。我们通过广泛的后门攻击(包括消融研究以及与现有方法的比较)展示了方法的有效性。我们的方法很有前景,因为所提出的五个度量量化了干净样本与毒化样本之间的固有差异。此外,我们的检测方法可通过追加更多可能为应对未来高级攻击而提出的度量来逐步改进。

关键词

引用

@article{arxiv.2307.05422,
  title  = {Differential Analysis of Triggers and Benign Features for Black-Box DNN Backdoor Detection},
  author = {Hao Fu and Prashanth Krishnamurthy and Siddharth Garg and Farshad Khorrami},
  journal= {arXiv preprint arXiv:2307.05422},
  year   = {2023}
}

备注

Published in the IEEE Transactions on Information Forensics and Security