中文

InFIP:一种基于内在特征的可解释 DNN 知识产权保护方法

计算机视觉与模式识别 2025-03-04 v1

摘要

深度神经网络(DNNs)的知识产权(IP)保护近年来引发了严重关切。大多数现有工作在 DNN 模型中嵌入水印以进行 IP 保护,这需要修改模型且缺乏可解释性。本文中,我们首次提出一种基于可解释人工智能的 DNN 可解释知识产权保护方法。与现有工作相比,所提方法不修改 DNN 模型,且所有权验证的决策是可解释的。我们利用深度泰勒分解提取 DNN 模型的内在特征。由于内在特征由模型决策的唯一解释构成,该内在特征可被视为模型的指纹。若疑似模型指纹与原始模型相同,则该疑似模型被视为盗版模型。实验结果表明,指纹可成功用于验证模型所有权,且模型的测试精度不受影响。此外,所提方法对微调攻击、剪枝攻击、水印覆盖攻击和自适应攻击具有鲁棒性。

关键词

引用

@article{arxiv.2210.07481,
  title  = {InFIP: An Explainable DNN Intellectual Property Protection Method based on Intrinsic Features},
  author = {Mingfu Xue and Xin Wang and Yinghao Wu and Shifeng Ni and Yushu Zhang and Weiqiang Liu},
  journal= {arXiv preprint arXiv:2210.07481},
  year   = {2025}
}