基于类的条件神经极化器:一种轻量且有效的后门防御方法,通过净化受毒化特征
密码学与安全
2025-02-27 v1 人工智能
摘要
近期研究揭示了深度神经网络对后门攻击的脆弱性,即使在良性样本和触发器信息共存的情况下,模型仍会被操纵以依赖嵌入受毒化样本中的触发器。尽管已提出多种防御方法,但它们往往在后门缓解与维持良性性能之间难以取得平衡。本文灵感来源于光学偏振器——一种允许特定偏振光通过而过滤其他偏振光的器件——提出了一种轻量级后门防御方法NPD。该方法将神经偏振器(NP)作为受损模型中的中间层实现,作为通过双层优化实现的轻量级线性变换。该方法能有效过滤受毒化样本中的触发器信息,同时保留良性内容。尽管其有效性显而易见,但我们通过实证研究发现,NPD在目标标签(用于净化)被错误估计时性能会下降。为解决这一局限性并充分发挥有针对性对抗缓解潜力,本文提出了基于类的条件神经偏振器防御(CNPD)。其核心创新是融合模块,将受损模型的预测标签与待净化特征相结合。该架构在无需标签估计的情况下内在地模拟了有针对性的对抗防御机制。我们提出了CNPD的三种实现方式:第一种是r-CNPD,通过为每个类别训练复制的NP层,在推理时根据受损模型预测的类别选择相应的NP层进行防御。为高效处理大量类别,本文还设计了两种变体:e-CNPD将类别信息作为额外特征嵌入,a-CNPD则利用类别信息引导网络注意力。
引用
@article{arxiv.2502.18520,
title = {Class-Conditional Neural Polarizer: A Lightweight and Effective Backdoor Defense by Purifying Poisoned Features},
author = {Mingli Zhu and Shaokui Wei and Hongyuan Zha and Baoyuan Wu},
journal= {arXiv preprint arXiv:2502.18520},
year = {2025}
}