激发未见:检测黑盒模型中的隐藏后门
计算机视觉与模式识别
2025-04-08 v2 人工智能
机器学习
摘要
视觉提示(VP)是一种新技术,能将训练良好的冻结模型从源域任务适配到目标域任务。本研究考察了 VP 在黑盒模型级后门检测中的优势。VP 中的视觉提示在源域和目标域之间映射类子空间。我们发现了一个错位,称为类子空间不一致,存在于干净数据集和投毒数据集之间。基于此,我们提出了 BProm,一种黑盒模型级检测方法,用于识别可疑模型中的后门(如果存在)。BProm 利用了当存在后门时提示模型的低分类准确率。大量实验证实了 BProm 的有效性。
引用
@article{arxiv.2411.09540,
title = {Prompting the Unseen: Detecting Hidden Backdoors in Black-Box Models},
author = {Zi-Xuan Huang and Jia-Wei Chen and Zhi-Peng Zhang and Chia-Mu Yu},
journal= {arXiv preprint arXiv:2411.09540},
year = {2025}
}
备注
This paper has been accepted by IEEE/IFIP DSN 2025