REFIT:面向数据受限深度学习系统的统一水印去除框架
密码学与安全
2021-03-26 v3 机器学习
摘要
从头训练深度神经网络可能计算代价高昂且需要大量训练数据。近期工作探索了不同的水印技术以保护预训练深度神经网络免受潜在的版权侵犯。然而,这些技术可能易受水印去除攻击。在本工作中,我们提出REFIT,一种基于微调的统一水印去除框架,其不依赖水印知识,且对广泛的水印方案有效。特别地,我们研究了一个现实攻击场景,其中 adversary 拥有有限的训练数据,而先前针对水印方案的攻击工作未强调这一点。为在该弱威胁模型下有效去除水印且不损害模型功能,我们提出两种并入微调框架的技术:(1)弹性权重巩固(EWC)算法的适配,该算法最初为缓解灾难性遗忘现象而提出;以及(2)无标签数据增强(AU),其中我们利用来自其他来源的辅助无标签数据。我们广泛的评估显示了REFIT对多种水印嵌入方案的有效性。特别地,EWC与AU均显著减少了有效水印去除所需的带标签训练数据量,且用于AU的无标签数据样本不必与用于模型评估的良性数据同分布。实验结果表明,我们基于微调的水印去除攻击可对预训练模型的版权构成真实威胁,从而凸显进一步研究水印问题并提出更鲁棒的抗攻击水印嵌入方案的重要性。
引用
@article{arxiv.1911.07205,
title = {REFIT: A Unified Watermark Removal Framework For Deep Learning Systems With Limited Data},
author = {Xinyun Chen and Wenxiao Wang and Chris Bender and Yiming Ding and Ruoxi Jia and Bo Li and Dawn Song},
journal= {arXiv preprint arXiv:1911.07205},
year = {2021}
}
备注
ACM Asia Conference on Computer and Communications Security (AsiaCCS), 2021. Early version in ICML 2019 Workshop on Security and Privacy of Machine Learning. The first two authors contribute equally