中文

一种针对木马攻击的自适应黑盒防御(TrojDef)

密码学与安全 2022-09-07 v1 计算机视觉与模式识别

摘要

木马后门是一种针对神经网络(NN)分类器的投毒攻击,其中攻击者试图利用(高度理想的)模型复用特性,通过投毒训练过程将木马植入模型参数以实现后门突破。大多数已提出的针对木马攻击的防御假设为白盒设置,即防御者要么能访问 NN 的内部状态,要么能对其运行反向传播。在本工作中,我们提出一种更实用的黑盒防御,称为 TrojDef,它只能运行 NN 的前向传播。TrojDef 试图通过监测当输入被随机噪声反复扰动时预测置信度的变化,来识别并过滤掉木马输入(即被添加了木马触发器的输入)。我们基于预测输出推导出一个称为预测置信度界的函数,以判定输入样本是否为木马。其直觉在于,木马输入更为稳定,因为误分类仅依赖于触发器,而良性输入由于分类特征受到扰动,在叠加噪声时会受到影响。通过数学分析,我们表明若攻击者在注入后门时是完美的,则被木马感染的模型将被训练以学习恰当的预测置信度界,该界用于在任意扰动下区分木马与良性输入。然而,由于攻击者在注入后门时可能并不完美,我们引入了对预测置信度界的非线性变换,以在实际设置中提高检测准确率。大量实证评估表明,TrojDef 显著优于最先进的防御方法,并在不同设置下高度稳定,即便分类器架构、训练过程或超参数发生变化时亦然。

关键词

引用

@article{arxiv.2209.01721,
  title  = {An Adaptive Black-box Defense against Trojan Attacks (TrojDef)},
  author = {Guanxiong Liu and Abdallah Khreishah and Fatima Sharadgah and Issa Khalil},
  journal= {arXiv preprint arXiv:2209.01721},
  year   = {2022}
}