面向 NLP 模型保护的抗蒸馏水印
计算与语言
2022-10-25 v2 机器学习
摘要
我们如何保护已训练 NLP 模型的知识产权?现代 NLP 模型易通过查询并从其公开 API 蒸馏而遭窃取。然而,现有的水印等保护方法仅适用于图像,并不适用于文本。我们提出抗蒸馏水印 (Distillation-Resistant Watermarking, DRW),一种保护 NLP 模型免遭蒸馏窃取的新技术。DRW 通过将水印注入受害者对应于密钥的预测概率来保护模型,并能够通过探测可疑模型检测出该密钥。我们证明受保护模型仍在特定界内保持原有准确率。我们在文本分类、词性标注与命名实体识别等多样 NLP 任务上评估 DRW。实验表明,DRW 对所有四项任务均以 100% 平均精度保护原模型并检测窃取嫌疑,而先前方法在两项任务上失败。
引用
@article{arxiv.2210.03312,
title = {Distillation-Resistant Watermarking for Model Protection in NLP},
author = {Xuandong Zhao and Lei Li and Yu-Xiang Wang},
journal= {arXiv preprint arXiv:2210.03312},
year = {2022}
}