中文

在有限数据下去除神经网络中基于后门的水印

计算机视觉与模式识别 2020-08-11 v2

摘要

深度神经网络已广泛应用并在各领域取得巨大成功。由于训练深度模型通常消耗大量数据与计算资源,如今训练好的深度模型的交易需求巨大且利润丰厚。遗憾的是,朴素的交易方案通常涉及与版权和可信度问题相关的潜在风险,例如,已售模型可在未经进一步授权的情况下被非法转售给他人以牟取暴利。为解决此问题,人们提出了多种水印技术来保护模型知识产权,其中基于后门的水印是最常用的一种。然而,这些水印方法的鲁棒性在现实设置下(如分布内数据有限可用且水印模式未知)未得到充分评估。本文对水印的鲁棒性进行基准测试,并提出一种利用有限数据的新型基于后门的水印去除框架,称为 WILD。所提出的 WILD 仅使用一小部分训练数据即可去除深度模型的水印,且输出模型的表现与从未注入水印从头训练的模型相同。特别地,利用一种新颖的数据增强方法来模拟水印触发器的行为。结合正常数据与扰动(如遮挡)数据在特征空间中的分布对齐,我们的方法在所有典型触发内容类型上均具有良好泛化性。实验结果表明,在仅有限访问训练数据的情况下,我们的方法能有效去除水印且不损害深度模型在原始任务上的性能。

关键词

引用

@article{arxiv.2008.00407,
  title  = {Removing Backdoor-Based Watermarks in Neural Networks with Limited Data},
  author = {Xuankai Liu and Fengting Li and Bihan Wen and Qi Li},
  journal= {arXiv preprint arXiv:2008.00407},
  year   = {2020}
}