中文

面向后门防御的主动解缠触发-对象配对建模

计算机视觉与模式识别 2025-08-05 v1 人工智能

摘要

深度神经网络 (DNN) 和生成式人工智能 (GenAI) 正日益暴露于后门攻击,攻击者会在输入中植入触发器以导致模型对目标标签进行错误分类或误解释。除了传统的单触发器场景外,攻击者可能在各种对象类别上注入多个触发器,形成难以被标准检测管道发现的未知后门-对象配置。本文引入 DBOM(Disentangled Backdoor-Object Modeling),一种主动框架,利用结构化解缠技术在数据层面识别并中和已知和未知后门威胁。具体而言,DBOM 通过使用视觉语言模型 (VLM) 将输入图像表示分解为触发器和对象的独立原始素子。利用 VLM 的冻结预训练编码器,我们的方法通过可学习的视觉提示存储库和提示前缀调谋,将潜在表示分解为独立组件,以确保触发器与对象的关系被显式捕获。为在视觉提示存储库中分离触发器和对象表示,我们引入触发器-对象分离和多样性损失,以辅助解缠触发器和对象视觉特征。随后,通过对齐图像特征与特征分解与融合以及在共享多模态空间中的学习的上下文提示标记,DBOM 实现对训练期间未出现的新型触发器-对象配对的零样例泛化,从而提供对对抗攻击模式的更深入见解。在 CIFAR-10 和 GTSRB 上的实验结果表明,DBOM 能稳健地检测到被毒化的图像,显著提升 DNN 训练管道的安全性。

关键词

引用

@article{arxiv.2508.01932,
  title  = {Proactive Disentangled Modeling of Trigger-Object Pairings for Backdoor Defense},
  author = {Kyle Stein and Andrew A. Mahyari and Guillermo Francia and Eman El-Sheikh},
  journal= {arXiv preprint arXiv:2508.01932},
  year   = {2025}
}