对抗稀疏教师:利用对抗样本防御基于蒸馏的模型窃取攻击
机器学习
2024-07-23 v2 密码学与安全
计算机视觉与模式识别
摘要
我们介绍了对抗稀疏教师 (AST),这是一种针对基于蒸馏的模型窃取攻击的鲁棒防御方法。我们的方法利用对抗样本训练教师模型,以产生稀疏的 logit 响应并增加输出分布的熵。通常,模型会在其预测对应的输出处产生一个峰值。通过利用对抗样本,AST 修改了教师模型的原始响应,在输出中嵌入少量经过改变的 logits,同时保持主要响应略高。与此同时,所有剩余的 logits 都被提升以进一步增加输出分布的熵。所有这些复杂的操作都是通过结合我们提出的指数预测散度 (EPD) 损失函数的优化函数执行的。与传统的 KL 散度相比,EPD 允许我们维持更高的熵水平,从而有效地迷惑攻击者。在 CIFAR-10 和 CIFAR-100 数据集上的实验表明,AST 优于最先进的方法,在保持高精度的同时提供了针对模型窃取的有效防御。源代码将很快在此公开。
引用
@article{arxiv.2403.05181,
title = {Adversarial Sparse Teacher: Defense Against Distillation-Based Model Stealing Attacks Using Adversarial Examples},
author = {Eda Yilmaz and Hacer Yalim Keles},
journal= {arXiv preprint arXiv:2403.05181},
year = {2024}
}
备注
14 pages, 3 figures, 11 tables