通过类子空间正交化提高后门检测器灵敏度
机器学习
2025-12-10 v1
摘要
大多数后训练后后门检测方法依赖于受攻击模型在目标类别相对于非目标类别上表现出极端异常检测统计。然而,这些方法可能失败:(1)当某些(非目标)类别与所有其他类别容易被区分时,它们可能自然实现极端检测统计(例如决策置信度);(2)当后门较为隐蔽,即其特征相对于内在类别判别特征较弱时。一个关键观察是,后门目标类别的检测统计来源于后门触发器和其内在特征两个方面,而非目标类别仅来自其内在特征。为了实现更灵敏的检测器,我们提出抑制内在特征,同时针对给定类别优化检测统计。对于非目标类别,抑制内在特征将大幅降低可实现的统计值,而对于目标类别,来自后门触发器的(显著)贡献仍然保留。实际中,我们构建了一个受约束的优化问题,利用给定类别的少量干净样本,在对抗化内在特征的同时优化检测统计。我们将这种即插即用的方法称为类子空间正交化(CSO),并通过对抗混合标签和自适应攻击进行评估。
引用
@article{arxiv.2512.08129,
title = {Improving the Sensitivity of Backdoor Detectors via Class Subspace Orthogonalization},
author = {Guangmingmei Yang and David J. Miller and George Kesidis},
journal= {arXiv preprint arXiv:2512.08129},
year = {2025}
}