神经偏振器:一种通过净化中毒特征实现的轻量高效后门防御方法
人工智能
2023-06-30 v1 密码学与安全
摘要
近期研究已表明深度神经网络易受后门攻击。给定一个植入后门的模型,尽管触发信息与良性信息共存,其对带触发器的中毒样本的预测将由触发器信息主导。受光学偏振器机制的启发——偏振器可透过具有特定偏振方向的光波而滤除其他偏振方向的光波——我们提出一种新颖的后门防御方法,将可学习的神经偏振器作为中间层插入后门模型中,以通过滤除触发器信息而保留良性信息来净化中毒样本。神经偏振器被实例化为一个轻量线性变换层,基于有限的干净数据集,通过求解一个精心设计的双层优化问题来学习。与通常调整后门模型全部参数的其他基于微调的防御方法相比,所提方法仅需学习一个附加层,因而更高效且需要更少干净数据。大量实验证明了我们的方法在各种神经网络架构与数据集上移除后门的有效性与高效性,尤其在干净数据极少的情况下。
引用
@article{arxiv.2306.16697,
title = {Neural Polarizer: A Lightweight and Effective Backdoor Defense via Purifying Poisoned Features},
author = {Mingli Zhu and Shaokui Wei and Hongyuan Zha and Baoyuan Wu},
journal= {arXiv preprint arXiv:2306.16697},
year = {2023}
}