基于鲁棒平滑分类器的单图像后门逆推
计算机视觉与模式识别
2023-12-19 v2
摘要
后门逆推作为许多后门防御的核心步骤,是一种逆向工程过程,用于恢复植入机器学习模型中的隐藏后门触发器。现有方法通过搜索能够将一组干净图像翻转到目标类的后门模式来解决此问题,而该支撑集所需的确切规模却鲜有研究。在本工作中,我们提出一种新颖的后门逆推方法,其仅用单张图像即可恢复隐藏后门。受近期对抗鲁棒性进展的启发,我们的方法 SmoothInv 从单张干净图像出发,随后在原始后门分类器的鲁棒平滑版本上,朝目标类执行投影梯度下降。我们发现后门模式由此种优化过程自然浮现。与现有后门逆推方法相比,SmoothInv 引入最少的优化变量且不需要复杂的正则化方案。我们对现有后门攻击所得的后门分类器进行了全面的定量与定性研究。我们证明 SmoothInv 始终能从单张图像恢复成功的后门:对于后门化的 ImageNet 分类器,我们重建的后门具有接近 100% 的攻击成功率。我们还表明它们与底层真实后门保持高保真度。最后,我们提出并分析了针对我们方法的两种对策,并表明 SmoothInv 在面对自适应攻击者时仍保持鲁棒。我们的代码见 https://github.com/locuslab/smoothinv。
引用
@article{arxiv.2303.00215,
title = {Single Image Backdoor Inversion via Robust Smoothed Classifiers},
author = {Mingjie Sun and J. Zico Kolter},
journal= {arXiv preprint arXiv:2303.00215},
year = {2023}
}
备注
CVPR 2023. v2: improved writing