中文

从内部诊断到外部审计:一种VLM驱动的在线测试时后门防御范式

机器学习 2026-01-28 v1 密码学与安全

摘要

深度神经网络本质上仍然容易受到后门攻击。传统的测试时防御主要在内部诊断方法的范式下运行,例如模型修复或输入鲁棒性,但这些方法在高级攻击下往往很脆弱,因为它们仍然与被攻击模型的受损参数纠缠在一起。我们提出了一种从内部诊断到外部语义审计的范式转变,认为有效的防御需要通过一个独立的、基于语义的审计器将安全性与被攻击模型解耦。为此,我们提出了一个框架,利用通用视觉-语言模型(VLM)作为不断演进的语义守门人。我们引入了PRISM(通过统计监控进行原型精炼与检查),它通过两个关键机制克服了通用VLM的领域差距:一个在线动态精炼视觉原型的混合VLM教师,以及一个由统计边际监控驱动的自适应路由器,用于实时校准门控阈值。在17个数据集和11种攻击类型上的广泛评估表明,PRISM达到了最先进的性能,在CIFAR-10上将攻击成功率抑制到<1%,同时提高了干净准确率,为模型无关的、外部化的安全建立了一个新标准。

关键词

引用

@article{arxiv.2601.19448,
  title  = {From Internal Diagnosis to External Auditing: A VLM-Driven Paradigm for Online Test-Time Backdoor Defense},
  author = {Binyan Xu and Fan Yang and Xilin Dai and Di Tang and Kehuan Zhang},
  journal= {arXiv preprint arXiv:2601.19448},
  year   = {2026}
}

备注

19 pages, 10 figures, 12 tables