神经网络中基于后门的水印持久性:综合评估
机器学习
2025-05-12 v3 密码学与安全
多媒体
摘要
深度神经网络(DNN)近年来因其无与伦比的结果而获得了相当大的关注。然而,训练如此复杂模型的成本是资源密集型的,导致许多人认为DNN是模型所有者的知识产权(IP)。在这个云计算时代,高性能DNN通常部署在互联网上,以便公众可以访问它们。因此,DNN水印方案,特别是基于后门的水印,近年来被积极开发以保护所有权。然而,现有的后门水印方案在面对对抗性攻击以及诸如微调神经网络模型等非预期手段时的鲁棒性存在很大的不确定性。原因之一是在基于后门的水印背景下无法保证完全的鲁棒性。在本文中,我们广泛评估了近期神经网络中基于后门的水印在微调场景下的持久性,并提出/开发了一种新颖的数据驱动思想,在微调后无需暴露触发集即可恢复水印。我们的实证结果表明,如果在微调过程中模型参数没有发生剧烈变化,仅通过引入微调后的训练数据,水印就可以被恢复。根据使用的触发样本类型,触发准确率可以恢复到高达100%。我们的研究进一步通过损失景观可视化探索了恢复过程的工作原理,以及引入训练数据到微调阶段以减轻水印消失的想法。
引用
@article{arxiv.2501.02704,
title = {Persistence of Backdoor-based Watermarks for Neural Networks: A Comprehensive Evaluation},
author = {Anh Tu Ngo and Chuan Song Heng and Nandish Chattopadhyay and Anupam Chattopadhyay},
journal= {arXiv preprint arXiv:2501.02704},
year = {2025}
}
备注
Accepted by IEEE Transactions on Neural Networks and Learning Systems (TNNLS)