中文

无模型性能退化的神经网络脆弱水印

计算机视觉与模式识别 2024-12-10 v1

摘要

深度神经网络易受数据投毒和后门攻击等恶意微调攻击。因此,近期研究提出了如何检测神经网络模型的恶意微调。然而,这通常会对被保护模型的性能产生负面影响。为此,我们提出一种无模型性能退化的新型神经网络脆弱水印。在水印嵌入过程中,我们训练一个具有特定损失函数和密钥的生成模型,以生成对目标分类器微调敏感的触发器。在验证过程中,我们采用带水印的分类器获取每个脆弱触发器的标签。然后,通过比较密钥与标签可检测恶意微调。在经典数据集和分类器上的实验表明,所提方法能有效检测模型恶意微调且无模型性能退化。

关键词

引用

@article{arxiv.2208.07585,
  title  = {Neural network fragile watermarking with no model performance degradation},
  author = {Zhaoxia Yin and Heng Yin and Xinpeng Zhang},
  journal= {arXiv preprint arXiv:2208.07585},
  year   = {2024}
}

备注

Published in 2022 IEEE International Conference on Image Processing (ICIP)