作为模型提取防御的纠缠水印
密码学与安全
2021-02-22 v2 机器学习
摘要
机器学习涉及昂贵的数据收集和训练过程。模型所有者可能担心,如果对手发起模型提取攻击,宝贵的知识产权会泄露。由于在不牺牲显著预测精度的情况下难以防御模型提取,水印技术转而利用未使用的模型容量使模型对离群输入-输出对过拟合。此类对即为水印,它们不从任务分布中采样,且仅防御者知晓。防御者随后在推理时展示对这些输入-输出对的知识以主张模型所有权。水印的有效性仍然有限,因为它们与任务分布不同,从而可通过压缩或其他形式的知识迁移轻易移除。我们提出纠缠水印嵌入(EWE)。我们的方法促使模型学习用于对来自任务分布的数据和编码水印的数据进行分类的特征。试图移除与合法数据纠缠的水印的对手也被迫牺牲合法数据上的性能。在 MNIST、Fashion-MNIST、CIFAR-10 和 Speech Commands 上的实验验证了防御者能以 95% 置信度主张模型所有权,对被盗副本的查询少于 100 次,且受防御模型性能的平均代价低于 0.81 个百分点。
引用
@article{arxiv.2002.12200,
title = {Entangled Watermarks as a Defense against Model Extraction},
author = {Hengrui Jia and Christopher A. Choquette-Choo and Varun Chandrasekaran and Nicolas Papernot},
journal= {arXiv preprint arXiv:2002.12200},
year = {2021}
}
备注
published in 30th USENIX Security Symposium