SSLGuard:一种面向自监督学习预训练编码器的水印方案
密码学与安全
2022-09-02 v4 机器学习
摘要
自监督学习是一种新兴的机器学习范式。相较于利用高质量标注数据集的监督学习,自监督学习依赖无标注数据集来预训练强大的编码器,这些编码器随后可作为各类下游任务的特征提取器。海量数据与计算资源的消耗使得编码器本身成为模型所有者宝贵的知识产权。近期研究表明,机器学习模型的版权受到模型窃取攻击的威胁,此类攻击旨在训练替代模型以模仿给定模型的行为。我们实证表明预训练编码器极易遭受模型窃取攻击。然而,当前大多数版权保护算法(如水印)的努力集中于分类器。同时,预训练编码器版权保护的内在挑战在很大程度上未被研究。我们提出 SSLGuard(首个面向预训练编码器的水印方案)以填补此空白。给定一个干净的预训练编码器,SSLGuard 向其注入水印并输出带水印版本。影子训练技术也被应用以在潜在模型窃取攻击下保留水印。我们广泛的评估表明,SSLGuard 在水印注入与验证方面有效,并且对模型窃取及输入加噪、输出扰动、覆盖、模型剪枝和微调等其他水印去除攻击具有鲁棒性。
引用
@article{arxiv.2201.11692,
title = {SSLGuard: A Watermarking Scheme for Self-supervised Learning Pre-trained Encoders},
author = {Tianshuo Cong and Xinlei He and Yang Zhang},
journal= {arXiv preprint arXiv:2201.11692},
year = {2022}
}
备注
Accepted by CCS 2022