将解释作为水印:通过水印化特征归因实现无害且多比特模型所有权验证
密码学与安全
2024-09-11 v2 人工智能
机器学习
摘要
所有权验证是当前最关键且最广泛采用的事后方法,用于保护模型版权。一般而言,模型所有者通过检查第三方模型是否具有从其发布模型中"继承"的特定属性来确定其是否被盗用。目前,基于后门的模型水印是将此类属性植入发布模型的主要和前沿方法。然而,基于后门的方法存在两个致命缺陷:即有害性和模糊性。前者表明它们向水印模型中引入可控的恶意误分类行为(即后门),后者表明恶意用户可以通过寻找其他误分类样本轻易通过验证,导致所有权模糊。本文认为,这两个局限性源于现有水印方案的"零比特"本质,即它们利用预测状态(即是否误分类)进行验证。基于此理解,我们设计了一种新的水印范式,即解释作为水印(Explanation as a Watermark, EaaW),将验证行为植入到特征归因解释中而非模型预测中。具体而言,EaaW在不改变原始预测的情况下,将"多比特"水印植入到特定触发样本的特征归因解释中。我们受可解释人工智能启发,设计了水印嵌入和提取算法。特别是,我们的方法可用于不同任务(例如图像分类和文本生成)。广泛的实验验证了EaaW在有效性和无害性方面的优势,以及其对潜在攻击的抗性。
引用
@article{arxiv.2405.04825,
title = {Explanation as a Watermark: Towards Harmless and Multi-bit Model Ownership Verification via Watermarking Feature Attribution},
author = {Shuo Shao and Yiming Li and Hongwei Yao and Yiling He and Zhan Qin and Kui Ren},
journal= {arXiv preprint arXiv:2405.04825},
year = {2024}
}
备注
This paper is accepted by Network and Distributed System Security Symposium (NDSS) 2025