隔离触发器:检测与消除自适应后门攻击
摘要
深度学习模型在 various applications 中广泛部署,但仍然 vulnerable to stealthy adversarial threats,尤其是后门攻击。后门模型在 clean inputs 下正常工作,但当 specific trigger 到达时会 cause mispredictions。大多数现有后门防御方法假设 adversary only inject one backdoor with small and conspicuous triggers。然而,能够有效 bypass 现有防御的自适应后门会将 multiple trigger patterns 与 benign features 结合。为对抗此类攻击,我们提出 Isolate Trigger (IsTr),一个 accurate and efficient 的后门检测与缓解框架。IsTr 旨在消除 benign features 的影响并 reverse hidden triggers。我们观察到,model 的 feature extractor 更关注 benign features,而 classifier 更关注 trigger patterns。基于此差异,IsTr 设计了 Steps 和 Differential-Middle-Slice 来解决 isolating triggers from benign features 的检测挑战。此外,IsTr 采用 unlearning-based repair 方法移除 attacker-injected 和 natural backdoors,同时保持 model benign accuracy。我们在 digit recognition、face recognition 和 traffic sign recognition 三个真实场景中,对 IsTr 在 six representative backdoor attacks 上的效果进行了 extensive 评估,并与 seven state-of-the-art baseline 方法进行了比较。在大多数情况下,IsTr 将 detection overhead 降低了一个数量级,同时实现 over 95% detection accuracy,maintaining post-repair attack success rate below 3%,超越 baseline defenses。IsTr 对 various adaptive attacks 具有 robust 性,即使 trigger patterns 在 benign features 上高度 entanglement 也能有效工作。
引用
@article{arxiv.2508.04094,
title = {Isolate Trigger: Detecting and Eliminating Adaptive Backdoor Attacks},
author = {Chengrui Sun and Hua Zhang and Haoran Gao and Shang Wang and Zian Tian and Jianjin Zhao and Qi Li and Hongliang Zhu and Zongliang Shen and Anmin Fu},
journal= {arXiv preprint arXiv:2508.04094},
year = {2025}
}