利用锐度感知最小化增强基于微调的后门防御
人工智能
2023-10-31 v1
摘要
后门防御旨在检测或缓解攻击者引入的恶意触发器的效应,对机器学习的安全与完整性正变得愈发关键。基于良性数据的微调是一种消除后门模型中后门效应的天然防御手段。然而,近期研究表明,在给定有限良性数据时,朴素微调的防御性能较差。本工作中,我们从神经元视角对后门模型微调进行深入探究,发现后门相关神经元在微调过程中未能逃出局部极小。受后门相关神经元往往具有更大范数的观察启发,我们提出 FTSAM,一种新颖的后门防御范式,旨在通过将对锐度感知最小化与微调相结合来收缩后门相关神经元的范数。我们在多个基准数据集和网络架构上证明了方法的有效性,其达到了最先进的防御性能。总体而言,我们的工作为提升机器学习模型针对后门攻击的鲁棒性提供了有前景的途径。
引用
@article{arxiv.2304.11823,
title = {Enhancing Fine-Tuning Based Backdoor Defense with Sharpness-Aware Minimization},
author = {Mingli Zhu and Shaokui Wei and Li Shen and Yanbo Fan and Baoyuan Wu},
journal= {arXiv preprint arXiv:2304.11823},
year = {2023}
}