中文

面向深度模型的无目标攻击:利用迁移学习的安全漏洞

机器学习 2020-01-30 v3 密码学与安全 机器学习

摘要

由于训练数据不足以及从头训练深度神经网络的计算成本高昂,迁移学习已广泛应用于许多基于深度神经网络的应用中。一种常用的迁移学习方法是将预训练模型的一部分取出,在末端添加若干层,并使用小规模数据集重新训练新层。这种方法虽然高效且被广泛使用,却带来了安全漏洞,因为迁移学习所用的预训练模型通常是公开可用的,包括潜在的攻击者也能获取。本文表明,攻击者在除预训练模型外无任何额外知识的情况下,可发起一种高效且有效的暴力攻击,构造出能以高置信度触发每个目标类的输入样本。我们假设攻击者无法获取任何目标特定信息,包括来自目标类的样本、重训练后的模型以及Softmax分配给各类的概率,从而使攻击成为无目标的(target-agnostic)。据我们所知,这些假设使所有先前的攻击模型均不适用。为评估所提攻击,我们在人脸识别与语音识别任务上开展了一系列实验,展示了攻击的有效性。我们的工作揭示了在迁移学习设置下使用Softmax层时一个根本性的安全弱点。

关键词

引用

@article{arxiv.1904.04334,
  title  = {A Target-Agnostic Attack on Deep Models: Exploiting Security Vulnerabilities of Transfer Learning},
  author = {Shahbaz Rezaei and Xin Liu},
  journal= {arXiv preprint arXiv:1904.04334},
  year   = {2020}
}