神经注意力蒸馏:从深度神经网络中擦除后门触发器
机器学习
2021-01-28 v2 人工智能
摘要
深度神经网络(DNNs)已知易受后门攻击,这是一种训练时攻击,向一小部分训练数据中注入触发模式,从而在测试时控制模型的预测。后门攻击尤其危险,因为它们不影响模型在干净样本上的性能,却能在测试期间只要出现触发模式就欺骗模型做出错误预测。本文提出一种新颖的防御框架神经注意力蒸馏(NAD),用于从被植入后门的DNNs中擦除后门触发器。NAD利用教师网络在一小部分干净数据子集上指导被植入后门的学生网络微调,使学生网络的中间层注意力与教师网络对齐。教师网络可通过在同一干净子集上的独立微调过程获得。我们经实验表明,针对6种最先进的后门攻击,NAD仅使用5%的干净训练数据就能有效擦除后门触发器,且不会在干净样本上造成明显的性能下降。代码见 https://github.com/bboylyg/NAD。
引用
@article{arxiv.2101.05930,
title = {Neural Attention Distillation: Erasing Backdoor Triggers from Deep Neural Networks},
author = {Yige Li and Xixiang Lyu and Nodens Koren and Lingjuan Lyu and Bo Li and Xingjun Ma},
journal= {arXiv preprint arXiv:2101.05930},
year = {2021}
}
备注
19 pages, 14 figures, ICLR 2021