中文

从预训练模型中揭示秘密

密码学与安全 2022-07-21 v1 机器学习

摘要

随着使用大数据集训练深度学习模型负担的加重,迁移学习已被广泛采用到许多新兴深度学习算法中。诸如 BERT 之类的 Transformer 模型是自然语言处理的主力,并将迁移学习作为事实上的标准训练方法。一些大数据公司发布了使用若干流行数据集训练好的预训练模型,终端用户与研究人员再用自己的数据集对模型进行微调。迁移学习显著减少了训练模型的时间与精力。然而,这是以安全担忧为代价的。在本文中,我们展示了一个新的发现:预训练模型与微调模型在权重值上具有显著高的相似性。同时,我们证明即便对于相同模型也存在供应商特定的计算模式。基于这些新发现,我们提出了一种新的模型提取攻击,利用供应商特定的计算模式揭示黑盒受害模型所使用的模型架构与预训练模型,并基于微调模型与预训练模型之间的权重值相似性估计整个模型权重。我们还展示了权重相似性可通过一种新颖的权重提取剪枝来提高模型提取的可行性。

关键词

引用

@article{arxiv.2207.09539,
  title  = {Revealing Secrets From Pre-trained Models},
  author = {Mujahid Al Rafi and Yuan Feng and Hyeran Jeon},
  journal= {arXiv preprint arXiv:2207.09539},
  year   = {2022}
}