中文

ASSET:跨多种深度学习范式下的鲁棒后门数据检测

机器学习 2023-08-08 v2 人工智能 密码学与安全 计算机视觉与模式识别

摘要

后门数据检测传统上是在端到端监督学习(SL)设定中研究的。然而,近年来由于对标注数据需求较少,自监督学习(SSL)和迁移学习(TL)的采用日益广泛。在这些新设定中也已展现出成功的后门攻击。然而,我们缺乏对现有检测方法在多种学习设定下适用性的透彻理解。通过评估 56 种攻击设定,我们表明大多数现有检测方法的性能在不同攻击和投毒比例下差异显著,且全部在最优的干净标签(clean-label)攻击上失效。此外,当应用于 SSL 和 TL 时,它们要么变得不适用,要么遭受较大的性能损失。我们提出了一种称为偏移主动分离(ASSET)的新检测方法,其主动诱导后门样本与干净样本之间不同的模型行为,以促进二者的分离。我们还提供了自适应选择待移除可疑点数量的过程。在端到端 SL 设定中,ASSET 在不同攻击下防御性能的一致性以及对投毒比例变化的鲁棒性方面优于现有方法;特别是,它是唯一能够检测最优干净标签攻击的方法。此外,ASSET 在 SSL 和 TL 中的平均检测率分别比现有最佳方法高出 69.3% 和 33.2%,从而为这些新 DL 设定提供了首个实用的后门防御。我们开源该项目以推动进一步发展并鼓励参与:https://github.com/ruoxi-jia-group/ASSET。

关键词

引用

@article{arxiv.2302.11408,
  title  = {ASSET: Robust Backdoor Data Detection Across a Multiplicity of Deep Learning Paradigms},
  author = {Minzhou Pan and Yi Zeng and Lingjuan Lyu and Xue Lin and Ruoxi Jia},
  journal= {arXiv preprint arXiv:2302.11408},
  year   = {2023}
}

备注

18 pages, with 13 pages of main text