中文

激发未见:检测黑盒模型中的隐藏后门

计算机视觉与模式识别 2025-04-08 v2 人工智能 机器学习

摘要

视觉提示(VP)是一种新技术,能将训练良好的冻结模型从源域任务适配到目标域任务。本研究考察了 VP 在黑盒模型级后门检测中的优势。VP 中的视觉提示在源域和目标域之间映射类子空间。我们发现了一个错位,称为类子空间不一致,存在于干净数据集和投毒数据集之间。基于此,我们提出了 BProm,一种黑盒模型级检测方法,用于识别可疑模型中的后门(如果存在)。BProm 利用了当存在后门时提示模型的低分类准确率。大量实验证实了 BProm 的有效性。

关键词

引用

@article{arxiv.2411.09540,
  title  = {Prompting the Unseen: Detecting Hidden Backdoors in Black-Box Models},
  author = {Zi-Xuan Huang and Jia-Wei Chen and Zhi-Peng Zhang and Chia-Mu Yu},
  journal= {arXiv preprint arXiv:2411.09540},
  year   = {2025}
}

备注

This paper has been accepted by IEEE/IFIP DSN 2025