中文

蒸馏攻击对神经网络水印的有效性及应对策略

密码学与安全 2019-06-17 v1 机器学习

摘要

机器学习即服务与模型共享平台的兴起,提升了对模型进行叛徒追踪与著作权证明的需求。水印技术是现有保护模型版权方法的主要组成部分。在本文中,我们表明蒸馏这一被广泛使用的转换技术,是一种相当有效的攻击手段,可移除现有算法嵌入的水印。这种脆弱性源于以下事实:蒸馏不会保留模型中嵌入的、对于主学习任务而言冗余且独立的水印。我们设计了ingrain以应对破坏性的蒸馏。它用一个包含水印的ingrainer模型对神经网络进行正则化,并迫使该模型同时表示ingrainer的知识。我们广泛的评估表明,ingrain对蒸馏攻击更为鲁棒,且相对于其他广泛使用的转换技术,其鲁棒性与现有方法相当。

关键词

引用

@article{arxiv.1906.06046,
  title  = {Effectiveness of Distillation Attack and Countermeasure on Neural Network Watermarking},
  author = {Ziqi Yang and Hung Dang and Ee-Chien Chang},
  journal= {arXiv preprint arXiv:1906.06046},
  year   = {2019}
}