中文

原型引导的后门防御

计算机视觉与模式识别 2025-03-28 v1 人工智能 机器学习

摘要

深度学习模型容易受到后门攻击,这类攻击涉及恶意攻击者在训练数据的小子集上施加触发器,以导致误分类。各种触发器已被用于包括无需攻击者操控图像即可实现的语义触发器。生成式人工智能的出现简化了多样化受感染样本的生成。对不同触发器类型的鲁棒性对于有效防御至关重要。我们提出了原型引导后门防御(PGBD),这是一种可扩展的后处理防御方法,适用于各种触发器类型,包括之前未解决的语义触发器。PGBD利用激活空间几何位移来惩罚向触发器移动的方向。这是通过一种后处理微调步骤中的新型净化损失实现的。这种几何方法可以轻松扩展到所有类型的攻击。PGBD 在所有设置下都取得了更好的性能。我们还针对名人脸图像的一种新型语义攻击提出了首个防御。项目页面:此链接。

关键词

引用

@article{arxiv.2503.20925,
  title  = {Prototype Guided Backdoor Defense},
  author = {Venkat Adithya Amula and Sunayana Samavedam and Saurabh Saini and Avani Gupta and Narayanan P J},
  journal= {arXiv preprint arXiv:2503.20925},
  year   = {2025}
}