特洛伊木马之战:针对基于输出的特洛伊模型检测器的自适应攻击者
密码学与安全
2024-02-15 v1 机器学习
摘要
我们提出并分析了一种自适应攻击者,该攻击者能够重训练特洛伊深度神经网络(DNN),并知晓最先进的(SOTA)基于输出的特洛伊模型检测器。我们表明,此类攻击者可以确保:(1) 在嵌入触发器的样本和干净样本上均保持高准确率;(2) 绕过检测。我们的方法基于一个观察结果:DNN 参数的高维性提供了足够的自由度来同时实现这些目标。我们还通过允许重训练以重新校准其参数,使 SOTA 检测器具备自适应能力,从而对特洛伊模型与检测器的参数协同演化进行建模。随后,我们证明这种协同演化可以建模为一种迭代博弈,并证明该交互博弈的(最优)解能使攻击者成功实现上述目标。此外,我们提供了一种贪婪算法,供攻击者选择最少数量的输入样本以嵌入触发器。我们表明,对于 DNN 使用的交叉熵或对数似然损失函数,该贪婪算法能为所需嵌入触发器的输入样本数量提供可证明的保证。在四个多样化数据集(MNIST、CIFAR-10、CIFAR-100 和 SpeechCommand)上的大量实验表明,该攻击者能有效规避四种 SOTA 基于输出的特洛伊模型检测器:MNTD、NeuralCleanse、STRIP 和 TABOR。
引用
@article{arxiv.2402.08695,
title = {Game of Trojans: Adaptive Adversaries Against Output-based Trojaned-Model Detectors},
author = {Dinuka Sahabandu and Xiaojun Xu and Arezoo Rajabi and Luyao Niu and Bhaskar Ramasubramanian and Bo Li and Radha Poovendran},
journal= {arXiv preprint arXiv:2402.08695},
year = {2024}
}