抵御针对迁移学习的误分类攻击
机器学习
2022-02-10 v4 密码学与安全
摘要
迁移学习是一种基于从预训练模型(教师模型)迁移的知识高效生成新模型(学生模型)的流行技术。然而,教师模型通常公开可用以供共享与复用,这不可避免地引入了触发针对迁移学习系统严重攻击的漏洞。本文中,我们迈出缓解迁移学习中最先进误分类攻击之一的第一步。我们设计了一种通过基于激活的网络剪枝的蒸馏微分器,以削弱攻击可迁移性同时保持精度。我们采用来自变体微分器的集成结构以提升防御鲁棒性。为避免推理时集成规模膨胀,我们提出两阶段防御:首先执行学生模型推理以将待集成的候选微分器缩小范围,随后仅可选定少量固定数量的微分器来有效验证干净输入或拒绝对抗输入。我们在大型与小型图像识别任务上的综合评估证实,仅含 5 个微分器防御的学生模型对超过 90% 的对抗输入免疫,且精度损失小于 10%。我们的对比也表明,我们的设计优于先前有问题的防御。
引用
@article{arxiv.1908.11230,
title = {Defeating Misclassification Attacks Against Transfer Learning},
author = {Bang Wu and Shuo Wang and Xingliang Yuan and Cong Wang and Carsten Rudolph and Xiangwen Yang},
journal= {arXiv preprint arXiv:1908.11230},
year = {2022}
}
备注
This paper has been published in IEEE Transactions on Dependable and Secure Computing. https://doi.ieeecomputersociety.org/10.1109/TDSC.2022.3144988