中文

通过重新激活攻击打破后门防御的假安全感

计算机视觉与模式识别 2024-05-31 v2

摘要

深度神经网络在防御后门攻击方面面临持续挑战,导致攻击与防御之间的持续博弈。虽然现有后门防御策略在降低攻击成功率方面显示出前景,但我们能否确信后门威胁已从模型中真正被消除?为此,我们重新审视了在防御后的后门模型(称为防御模型)的特征。惊讶地发现,原始后门仍存在于来自现有后训练防御策略所得的防御模型中,后门存在性通过一种新型指标称为后门存在系数进行衡量。这表明后门仅处于潜伏状态而非被消除。为进一步验证这一发现,我们经验性地展示,这些潜伏的后门可通过操控原始触发器使用通用对抗攻击中的微小扰动轻松重新激活。在更实际的场景中,我们将后门重新激活扩展到黑箱场景,即防御模型仅在推理期间可被对手查询,并开发了两种有效方法,即查询式和迁移式后门重新激活攻击。在图像分类和多模态对比学习(即 CLIP)任务上验证了所提出方法的有效性。总之,本工作揭示了现有防御策略中从未被探索的关键漏洞,强调在未来必须设计更稳健和先进的后门防御机制的紧迫性。

关键词

引用

@article{arxiv.2405.16134,
  title  = {Breaking the False Sense of Security in Backdoor Defense through Re-Activation Attack},
  author = {Mingli Zhu and Siyuan Liang and Baoyuan Wu},
  journal= {arXiv preprint arXiv:2405.16134},
  year   = {2024}
}