中文

防御半监督学习中的后门攻击:过滤、阻断与稀释

机器学习 2025-02-11 v1

摘要

最近的研究表明,半监督学习 (SSL) 对数据投毒后门攻击极其脆弱。即使仅有极少量被污染的训练数据,即可被攻击者利用,操控最高可达 90% 的测试输出。鉴于后门攻击针对 SSL 的日益增长威胁,本工作旨在保护 SSL 免受此类风险,标志着已知少数 efforts 之一。具体而言,我们首先指出,后门触发器与目标类别之间伪相关性是攻击者在测试阶段操控模型预测的主要原因。为破坏这些相关性,我们利用三种关键技术:高斯滤波、互补学习和触发器混合,分别从数据预处理和特征学习中“过滤、阻断、稀释”后门攻击的影响。实验结果表明,我们提出的方法——Backdoor Invalidator (BI)——在不同最先进的后门攻击下,将平均攻击成功率从 84.7% 降至 1.8%。值得注意的是,BI 不会牺牲干净数据上的准确率,并获得其泛化能力的理论保证。

关键词

引用

@article{arxiv.2502.05755,
  title  = {Filter, Obstruct and Dilute: Defending Against Backdoor Attacks on Semi-Supervised Learning},
  author = {Xinrui Wang and Chuanxing Geng and Wenhai Wan and Shao-yuan Li and Songcan Chen},
  journal= {arXiv preprint arXiv:2502.05755},
  year   = {2025}
}