中文

面向自监督模型的数据集推断

机器学习 2023-01-18 v3 人工智能 密码学与安全

摘要

自监督模型在机器学习(ML)中日益普及,因为它们减少了对昂贵标注数据的需求。由于其下游应用的通用性,它们正日益作为通过公共API暴露的服务被使用。同时,这些编码器模型由于其输出的向量表示的高维性,特别容易受到模型窃取攻击。然而,编码器仍无防御:现有的窃取攻击缓解策略聚焦于监督学习。我们引入了一种新的数据集推断防御,它利用受害者编码器模型的私有训练集在遭遇窃取时归属其所有权。其直觉是,若编码器是从受害者处窃取的,则其在受害者训练数据上的输出表示的对数似然高于测试数据;但若为独立训练则不然。我们使用密度估计模型计算该对数似然。作为评估的一部分,我们还提出在不涉及下游任务的情况下衡量被盗编码器的保真度并量化窃取检测的有效性;相反,我们利用互信息和距离度量。我们在视觉领域的广泛实证结果表明,数据集推断是防御自监督模型免受模型窃取的一个有前景的方向。

关键词

引用

@article{arxiv.2209.09024,
  title  = {Dataset Inference for Self-Supervised Models},
  author = {Adam Dziedzic and Haonan Duan and Muhammad Ahmad Kaleem and Nikita Dhawan and Jonas Guan and Yannis Cattan and Franziska Boenisch and Nicolas Papernot},
  journal= {arXiv preprint arXiv:2209.09024},
  year   = {2023}
}

备注

Accepted at NeurIPS 2022; Updated experiment details