中文

BlockDoor:阻断深度神经网络中基于后门的水印

密码学与安全 2025-01-07 v1 机器学习

摘要

机器学习模型在各行业的广泛应用使深度神经网络(DNN)成为宝贵的知识产权(IP),需要保护其免遭窃取或未经授权的使用。这一课题催生了多种水印方案,通过这些方案可以确立模型的所有权。利用后门嵌入水印是文献中最成熟的方法,已有具体工作表明,作为后门嵌入网络权重中的水印难以被移除。然而,在我们的研究中,我们发现后门水印验证设计中存在一个关键缺陷,该缺陷与作为密钥的触发集样本的行为有关。在本文中,我们提出了 BlockDoor,这是一个综合技术包,可用作包装器来阻断文献中用于在训练好的神经网络中作为后门嵌入水印的三种不同类型的触发样本。通过 BlockDoor 实现的框架能够通过针对基于对抗噪声的触发器、分布外触发器和基于随机标签的触发器的独立函数,检测潜在的触发样本。除了对潜在触发样本实施简单的拒绝服务外,我们的方法还能够修改触发样本以恢复正确的机器学习功能。对 BlockDoor 的广泛评估表明,它能够将触发集的水印验证准确率显著降低高达 98%98\%,同时不损害功能性,在干净样本上的准确率下降不到 1%1\%。BlockDoor 已在多个数据集和神经架构上进行了测试。

关键词

引用

@article{arxiv.2412.12194,
  title  = {BlockDoor: Blocking Backdoor Based Watermarks in Deep Neural Networks},
  author = {Yi Hao Puah and Anh Tu Ngo and Nandish Chattopadhyay and Anupam Chattopadhyay},
  journal= {arXiv preprint arXiv:2412.12194},
  year   = {2025}
}

备注

Accepted as a Work-in-Progress paper at SPACE 2024: Fourteenth International Conference on Security, Privacy and Applied Cryptographic Engineering