针对基于预训练深度学习模型的迁移学习的后门攻击
机器学习
2020-08-11 v2 密码学与安全
摘要
迁移学习通过微调将预训练教师(Teacher)模型在大型数据集上习得的知识进行迁移,为可行且快速地定制准确的学生(Student)模型提供了有效方案。迁移学习中使用的许多预训练教师模型公开可用并由公共平台维护,这增加了其遭受后门攻击的脆弱性。本文中,我们利用公开可访问教师模型的知识,展示针对图像与时间序列数据上迁移学习任务的后门威胁,旨在击败三种常用防御:基于剪枝的、基于重训练的和基于输入预处理的防御。具体而言,(A)基于排序的选择机制,在击败基于剪枝和/或基于重训练的防御的同时,加速后门触发器生成与扰动过程。(B)提出自编码器驱动的触发器生成,以产生可击败基于输入预处理防御的鲁棒触发器,同时保证所选神经元可被显著激活。(C)防御感知重训练,利用逆向工程模型输入生成被操纵的模型。我们在真实世界图像、脑磁共振成像(MRI)数据与心电图(ECG)学习系统上对学生模型发起有效的误分类攻击。实验表明,在存在基于剪枝和/或基于重训练的防御时,我们的增强攻击在干净图像与时间序列输入上分别保持与原始模型相当的 与 分类准确率,同时将投毒图像与时间序列输入上的攻击成功率分别提升 与 。
引用
@article{arxiv.2001.03274,
title = {Backdoor Attacks against Transfer Learning with Pre-trained Deep Learning Models},
author = {Shuo Wang and Surya Nepal and Carsten Rudolph and Marthie Grobler and Shangyu Chen and Tianle Chen},
journal= {arXiv preprint arXiv:2001.03274},
year = {2020}
}