深度神经网络中基于后门的水印方法的鲁棒性研究
机器学习
2019-11-27 v2 密码学与安全
机器学习
摘要
由于繁琐的数据准备和巨大的处理需求,获取深度学习模型的当前最优性能给模型生成者带来了高昂成本。为保护模型免遭未经授权的再分发,过去几年中引入了水印方法。我们研究了当前最优的深度神经网络水印方案的鲁棒性与可靠性。我们聚焦于基于后门的水印,并提出了两种——一种黑盒和一种白盒——移除水印的攻击。我们的黑盒攻击以最小需求窃取模型并移除水印;它仅依赖于公开无标签数据和黑盒访问分类标签,不需要分类置信度或访问模型的敏感信息(如训练数据集、触发集或模型参数)。白盒攻击在带标记模型的参数可用时提出了一种高效的水印移除方法;我们的白盒攻击不需要访问带标签数据或触发集,并将黑盒攻击的运行时间最多提升十七倍。我们还通过提出一种检测模型是否含有水印的攻击,证明了基于后门的水印在保持水印不可检测性方面的安全性不足。我们的攻击表明,带标记模型的接收者可以以远低于训练新模型的代价移除基于后门的水印,并且需要其他一些技术来防范有动机的攻击者进行的再分发。
引用
@article{arxiv.1906.07745,
title = {On the Robustness of the Backdoor-based Watermarking in Deep Neural Networks},
author = {Masoumeh Shafieinejad and Jiaqi Wang and Nils Lukas and Xinda Li and Florian Kerschbaum},
journal= {arXiv preprint arXiv:1906.07745},
year = {2019}
}