中文

针对迁移学习的教师模型指纹攻击

密码学与安全 2022-06-24 v2 机器学习

摘要

迁移学习已成为实践中解决训练数据稀缺的常用方案。它通过复用或微调公开可用的训练良好的教师模型的前几层来训练指定的学生模型。然而,除了效用提升之外,迁移的公开知识也给模型机密性带来潜在威胁,并进一步引发其他安全与隐私问题。本文首次对迁移学习情境下的教师模型暴露威胁进行了全面研究,旨在深入理解公开知识与模型机密性之间的张力。为此,我们提出一种教师模型指纹攻击,以推断学生模型的来源,即其所迁移自的教师模型。具体而言,我们提出一种新颖的基于优化的方法,精心生成查询来探测学生模型以实现攻击。与现有的模型逆向工程方法不同,我们所提出的指纹方法既不依赖细粒度模型输出(如后验概率),也不依赖模型架构或训练数据集的辅助信息。我们系统评估了所提攻击的有效性。实证结果表明,该攻击仅需少量探测查询即可准确识别模型来源。此外,我们展示了所提攻击可作为便利其他针对机器学习模型攻击(如模型窃取)的垫脚石。

关键词

引用

@article{arxiv.2106.12478,
  title  = {Teacher Model Fingerprinting Attacks Against Transfer Learning},
  author = {Yufei Chen and Chao Shen and Cong Wang and Yang Zhang},
  journal= {arXiv preprint arXiv:2106.12478},
  year   = {2022}
}

备注

To Appear in the 31st USENIX Security Symposium