EntropyScan:通过视觉注意力熵实现 LVLMs 模型级后门检测
计算机视觉与模式识别
2026-05-18 v1
摘要
大型视觉语言模型(LVLMs)在各种任务中展现出卓越的能力,但它们仍然容易受到后门攻击。现有的防御方法主要集中在样本级防御,依赖于训练数据或触发器的知识。然而,识别给定模型是否被植入后门仍然是一项关键但尚未探索的任务。为填补这一空白,我们提出了 EntropyScan,一种用于 LVLMs 模型级后门检测的轻量级且与触发器无关的方法。我们首先观察到,后门注入会破坏跨模态对齐,导致在良性样本上的视觉注意力分配出现显著的结构异常。基于这一洞察,EntropyScan 通过量化这种注意力偏差来检测后门模型。具体而言,它从大型语言模型(LLM)的初始层提取视觉注意力分布,并应用 Tsallis 熵来捕捉这些结构扭曲。通过在一小组良性样本上采用参考锚定的 Z 分数归一化,它有效地识别出被植入后门的模型。跨两种 LVLMs 架构和三种先进攻击场景的大量实验表明,EntropyScan 平均达到 98.5% 的 F1 分数和 96.6% 的 AUC。我们的代码将很快公开。
引用
@article{arxiv.2605.15711,
title = {EntropyScan: Towards Model-level Backdoor Detection in LVLMs via Visual Attention Entropy},
author = {Xuanyu Ge and Zhongqi Wang and Jie Zhang and Shiguang Shan and Xilin Chen},
journal= {arXiv preprint arXiv:2605.15711},
year = {2026}
}
备注
20 pages, 6 figures, 8tables