中文

基于信息论视角探讨基于后门的模型水印技术弱点

密码学与安全 2024-09-11 v1 人工智能

摘要

机器学习模型的知识产权保护近年来成为 AI 安全中的迫切关切。模型水印是保护机器学习模型所有权的强大技术,但近期的水印移除攻击已挑战了其可靠性。本文从信息论角度探讨现有水印嵌入技术(特别是基于后门技术)的脆弱性。我们表明,水印对抗抹除攻击的韧性取决于触发样本的选择,其中当前使用分布外触发样本的做法对白盒对手 inherently 脆弱。基于此发现,我们提出一种新型模型水印方案,即分布内水印嵌入(In-distribution Watermark Embedding, IWE),以克服现有方法的局限。进一步为最小化与干净模型之间的差距,我们分析 logits 的作用作为水印信息载体,并提出新的方法更好地隐藏水印信息于 logits 中。在包括 CIFAR-100 和 Caltech-101 在内的真实数据集上实验表明,我们的方法对各种对手具有鲁健性,准确率损失 < 0.1%。

关键词

引用

@article{arxiv.2409.06130,
  title  = {On the Weaknesses of Backdoor-based Model Watermarking: An Information-theoretic Perspective},
  author = {Aoting Hu and Yanzhi Chen and Renjie Xie and Adrian Weller},
  journal= {arXiv preprint arXiv:2409.06130},
  year   = {2024}
}