L-RED:无需访问训练集的高效后训练不可感知后门攻击检测
计算机视觉与模式识别
2021-02-22 v2 机器学习
摘要
后门攻击(BAs)是一种新兴的对抗攻击形式,通常针对深度神经网络图像分类器。攻击者的目标是使分类器学会:当来自一个或多个源类的测试图像含有后门图案时将其分类至目标类,同时在所有干净测试图像上保持高准确率。基于逆向工程的防御(REDs)对抗 BAs 不需要访问训练集,而仅需一个独立的干净数据集。遗憾的是,大多数现有 REDs 依赖一个不现实的假设,即除目标类外的所有类均为攻击的源类。不依赖此假设的 REDs 往往需要大量干净图像与沉重计算负担。本文提出一种基于拉格朗日的 RED(L-RED),其不需要源类数量的知识(或是否存在攻击)。我们的防御仅需极少干净图像即可有效检测 BAs,且计算高效。值得注意的是,在 CIFAR-10 的实验中,我们每类仅用两张干净图像即检测出了 60 个 BAs 中的 56 个。
引用
@article{arxiv.2010.09987,
title = {L-RED: Efficient Post-Training Detection of Imperceptible Backdoor Attacks without Access to the Training Set},
author = {Zhen Xiang and David J. Miller and George Kesidis},
journal= {arXiv preprint arXiv:2010.09987},
year = {2021}
}