中文

类特征水印:抵御模型提取攻击的鲁棒黑盒水印

密码学与安全 2025-11-18 v2 计算机视觉与模式识别 机器学习

摘要

机器学习模型构成了宝贵的知识产权,但仍然容易受到模型提取攻击(MEA)的威胁,在这种攻击中,对手通过黑盒查询复制其功能。模型水印通过嵌入用于所有权验证的取证标记来对抗 MEA。当前的黑盒水印通过表示纠缠优先考虑 MEA 下的存活,但对抵御序列 MEA 和移除攻击的鲁棒性探索不足。我们的研究表明,这种风险被低估了,因为现有的移除方法被纠缠所削弱。为了弥补这一空白,我们提出了水印移除攻击(WRK),该方法通过利用由当前样本级水印伪影塑造的决策边界来规避纠缠约束。WRK 在现有的水印基准测试中有效地将水印成功率降低了至少 88.79%。为了提供鲁棒的保护,我们提出了类特征水印(CFW),它通过利用类级伪影来提高鲁棒性。CFW 使用域外样本构建了一个合成类,消除了原始域样本与其伪影修改对应物(水印样本)之间脆弱的决策边界。CFW 同时优化了 MEA 可迁移性和 MEA 后稳定性。跨多个域的实验表明,CFW 在鲁棒性方面始终优于现有方法,即使在组合的 MEA 和 WRK 扭曲下,在提取的模型中仍保持至少 70.15% 的水印成功率,同时保留了受保护模型的效用。

关键词

引用

@article{arxiv.2511.07947,
  title  = {Class-feature Watermark: A Resilient Black-box Watermark Against Model Extraction Attacks},
  author = {Yaxin Xiao and Qingqing Ye and Zi Liang and Haoyang Li and RongHua Li and Huadi Zheng and Haibo Hu},
  journal= {arXiv preprint arXiv:2511.07947},
  year   = {2025}
}

备注

Accepted by AAAI'26