泄露后恢复:针对泄露DNN模型白盒对抗样本的保护
密码学与安全
2022-10-18 v2
摘要
服务器泄露是当今互联网上不幸的现实。对于深度神经网络(DNN)模型而言,这尤其有害,因为泄露的模型使攻击者获得“白盒”权限来生成对抗样本,而这一威胁模型尚无实际鲁棒防御。对于投入多年及数百万资金于专有DNN(如医学影像)的从业者来说,这似乎是地平线上不可避免的灾难。本文考虑DNN模型的泄露后恢复问题。我们提出Neo,一种新系统,可创建泄露模型的新版本,并配备推理时过滤器以检测并移除基于先前泄露模型生成的对抗样本。不同模型版本的分类面略有偏移(通过引入隐藏分布),Neo检测攻击对其生成所用泄露模型的过拟合。我们表明,在多种任务和攻击方法下,Neo能够以极高准确率过滤来自泄露模型的攻击,并对反复泄露服务器的攻击者提供强力保护(7–10次恢复)。Neo对多种强自适应攻击表现良好,仅在可恢复泄露次数上略有下降,并展现出作为实际环境中DNN防御补充的潜力。
引用
@article{arxiv.2205.10686,
title = {Post-breach Recovery: Protection against White-box Adversarial Examples for Leaked DNN Models},
author = {Shawn Shan and Wenxin Ding and Emily Wenger and Haitao Zheng and Ben Y. Zhao},
journal= {arXiv preprint arXiv:2205.10686},
year = {2022}
}