BlackMirror:基于指令-响应偏差的文本到图像模型黑箱后门检测
计算机视觉与模式识别
2026-03-09 v1 人工智能
摘要
本文研究了在黑箱环境下检测被后门篡改的文本到图像模型这一具有挑战性的任务,提出了新颖的检测框架BlackMirror。现有方法通常依赖分析图像层面的相似性,假设后门触发的生成图像在样本间表现出强一致性。然而,这些方法难以泛化到近期出现的后门攻击,因为后门生成的图像可以呈现视觉多样性。BlackMirror灵感来自这样一个观察:在各种后门攻击中,仅生成图像中部分语义模式被稳定操控,而其余内容保持多样或良性。基于此,BlackMirror包含两个组件:MirrorMatch对齐视觉模式与对应指令,以检测语义偏差;MirrorVerify评估这些偏差在不同提示下的稳定性,以区分真实后门行为与良性响应。BlackMirror是一种通用、无需训练的框架,可作为Model-as-a-Service(MaaS)应用的即插即用模块。全面实验表明,BlackMirror在广泛的攻击范围内实现了准确检测。代码已公开于https://github.com/Ferry-Li/BlackMirror。
引用
@article{arxiv.2603.05921,
title = {BlackMirror: Black-Box Backdoor Detection for Text-to-Image Models via Instruction-Response Deviation},
author = {Feiran Li and Qianqian Xu and Shilong Bao and Zhiyong Yang and Xilin Zhao and Xiaochun Cao and Qingming Huang},
journal= {arXiv preprint arXiv:2603.05921},
year = {2026}
}
备注
This paper is accepted by CVPR 2026