中文

BackdoorIDS:针对预训练视觉编码器的零样态后门检测

计算机视觉与模式识别 2026-03-17 v2

摘要

自监督和多模态视觉编码器学习到强大的视觉表征,广泛应用于下游视觉任务和大型视觉语言模型(LVM)。然而,下游用户常依赖来源不明的第三方预训练编码器,暴露于后门攻击之下。在本工作中,我们提出BackdoorIDS,一种简单而有效的针对预训练视觉编码器的零样态、推理时后门样本检测方法。BackdoorIDS源于两个观察:注意力劫持与恢复。当输入逐渐遮蔽时,受后门控制的图像最初集中注意力于恶意触发器特征。一旦遮蔽比例超过触发器的鲁棒性阈值,触发器即被失活,注意力迅速转向良性内容。这种转变在图像嵌入中引起显著变化,而干净图像的嵌入在遮蔽过程中则演变得更平滑。BackdoorIDS通过沿遮蔽轨迹提取嵌入序列,并应用基于密度的聚类(如DBSCAN)来实现该信号。若输入的嵌入序列形成多个聚类,则将其标记为受后门控制。大量实验表明,BackdoorIDS在各种攻击类型、数据集和模型家族中均显著优于现有防御方法。值得注意的是,它是一种即插即用的方法,无需重新训练,完全以零样态在推理时运行,能够与广泛的编码器架构兼容,包括CNN、ViT、CLIP和LLaVA-1.5。

关键词

引用

@article{arxiv.2603.11664,
  title  = {BackdoorIDS: Zero-shot Backdoor Detection for Pretrained Vision Encoder},
  author = {Siquan Huang and Yijiang Li and Ningzhi Gao and Xingfu Yan and Leyu Shi and Ying Gao},
  journal= {arXiv preprint arXiv:2603.11664},
  year   = {2026}
}

备注

17 pages, 10 figures, 6 tables