论自监督学习防御模型提取的困难性
机器学习
2022-06-30 v3 人工智能
密码学与安全
摘要
自监督学习 (SSL) 是一种日益流行的机器学习范式,它训练模型将复杂输入转换为表示,而无需依赖显式标签。这些表示编码了相似性结构,能够高效学习多个下游任务。最近,机器学习即服务提供商已开始通过推理 API 提供训练好的 SSL 模型,这些 API 可将用户输入转换为有用的表示并收取费用。然而,训练这些模型的高昂成本以及它们通过 API 的暴露,都使得黑盒提取成为一个现实的安全威胁。因此,我们探索了针对 SSL 的模型窃取攻击。与传统的针对输出标签的分类器模型提取不同,此处的受害者模型输出的是表示;与分类器输出的低维预测分数相比,这些表示的维度要高得多。我们构建了几种新颖的攻击方法,并发现直接在受害者被盗表示上训练的方法查询效率高,并且能为下游模型实现高精度。然后,我们表明现有的针对模型提取的防御措施是不充分的,并且不易改造以适应 SSL 的特殊性。
引用
@article{arxiv.2205.07890,
title = {On the Difficulty of Defending Self-Supervised Learning against Model Extraction},
author = {Adam Dziedzic and Nikita Dhawan and Muhammad Ahmad Kaleem and Jonas Guan and Nicolas Papernot},
journal= {arXiv preprint arXiv:2205.07890},
year = {2022}
}
备注
Accepted at ICML 2022