DNN 水印中的深度保真度:分类模型后门水印研究
密码学与安全
2023-11-02 v2
摘要
后门水印是一种有前景的用于保护深度神经网络(DNN)模型版权的范式。在该主题的现有工作中,研究者密集关注水印鲁棒性,而关乎模型原始功能保持的保真度概念较少受到关注。本文聚焦于深度图像分类模型,指出已有仅以学习准确率作为单一度量的共有观念不足以刻画后门保真度。同时,我们表明多媒体水印中嵌入失真的类似概念,在 DNN 后门水印中解释为总权重损失(TWL),同样不利于保真度度量。为应对该挑战,我们提出深度保真度概念,即后门水印 DNN 模型应同时保持无 watermark 宿主模型的特征表示与决策边界。为实现深度保真度,我们提出两个损失函数,称为倒数第二层特征损失(PFL)与 softmax 概率分布损失(SPL)以保留特征表示,而决策边界由所提出的固定最后一层(FixLL)处理保持,其受近期发现的固定分类器的深度学习不造成学习准确率损失所启发。基于上述设计,我们从头嵌入与微调策略均被实现以评估后门嵌入的深度保真度,其相对于现有方法的优势通过使用 ResNet18 进行 MNIST 与 CIFAR-10 分类、以及宽残差网络(即 WRN28_10)进行 CIFAR-100 任务的实验得到验证。PyTorch 代码见 https://github.com/ghua-ac/dnn_watermark。
引用
@article{arxiv.2208.00563,
title = {Deep Fidelity in DNN Watermarking: A Study of Backdoor Watermarking for Classification Models},
author = {Guang Hua and Andrew Beng Jin Teoh},
journal= {arXiv preprint arXiv:2208.00563},
year = {2023}
}
备注
Published in Pattern Recognition