中文

EntropyScan:通过视觉注意力熵实现 LVLMs 模型级后门检测

计算机视觉与模式识别 2026-05-18 v1

摘要

大型视觉语言模型(LVLMs)在各种任务中展现出卓越的能力,但它们仍然容易受到后门攻击。现有的防御方法主要集中在样本级防御,依赖于训练数据或触发器的知识。然而,识别给定模型是否被植入后门仍然是一项关键但尚未探索的任务。为填补这一空白,我们提出了 EntropyScan,一种用于 LVLMs 模型级后门检测的轻量级且与触发器无关的方法。我们首先观察到,后门注入会破坏跨模态对齐,导致在良性样本上的视觉注意力分配出现显著的结构异常。基于这一洞察,EntropyScan 通过量化这种注意力偏差来检测后门模型。具体而言,它从大型语言模型(LLM)的初始层提取视觉注意力分布,并应用 Tsallis 熵来捕捉这些结构扭曲。通过在一小组良性样本上采用参考锚定的 Z 分数归一化,它有效地识别出被植入后门的模型。跨两种 LVLMs 架构和三种先进攻击场景的大量实验表明,EntropyScan 平均达到 98.5% 的 F1 分数和 96.6% 的 AUC。我们的代码将很快公开。

关键词

引用

@article{arxiv.2605.15711,
  title  = {EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy},
  author = {Xuanyu Ge and Zhongqi Wang and Jie Zhang and Shiguang Shan and Xilin Chen},
  journal= {arXiv preprint arXiv:2605.15711},
  year   = {2026}
}

备注

20 pages, 6 figures, 8tables