中文

吸收关系: 面向视觉语言预训练模型的模型层级后门检测

计算机视觉与模式识别 2025-12-02 v1

摘要

视觉语言预训练模型(VLPs)如 CLIP 取得了显著的成功,但也高度脆弱于后门攻击。给定经不可信第三方微调的模型,确定其是否被植入后门是一项关键且具有挑战性的问题。现有检测方法通常依赖于训练数据集、后门触发器和目标,或下游分类器,这些方法在实际应用中可能难以实现。为此,本文引入一种新型模型层级检测框架——Assimilation Matters in DETection(AMDET),其无需任何此类先验知识。具体而言,我们首次揭示了后门文本编码器中的特征吸收属性:后门样本中所有标记的表示都呈现高度相似性。进一步分析将这一效应归因于注意力权重对触发标记的集中。基于此洞察,AMDET通过对标记嵌入执行梯度基于反向推理,以恢复能够激活后门行为的隐式特征。此外,我们识别出OpenAI官方 CLIP 模型中存在的自然后门特征,这些特征并非刻意植入,但仍表现出类似后门的行为。我们随后通过分析其损失景观来将其从真实植入的后门中筛选出来。在3600个被后门和良性微调的模型上进行的大量实验表明,AMDET在两种攻击范式和三种 VLP 模型结构上,能够以89.90%的F1分数检测后门。此外,它在RTX 4090 GPU上约5分钟即可完成一次完整检测,并对适应性攻击表现出强大的鲁棒性。代码已公开:https://github.com/Robin-WZQ/AMDET

关键词

引用

@article{arxiv.2512.00343,
  title  = {Assimilation Matters: Model-level Backdoor Detection in Vision-Language Pretrained Models},
  author = {Zhongqi Wang and Jie Zhang and Shiguang Shan and Xilin Chen},
  journal= {arXiv preprint arXiv:2512.00343},
  year   = {2025}
}