中文

检测分类模型中的语义后门:神秘购物场景

机器学习 2026-01-08 v1

摘要

检测分类模型中的语义后门——即某些类可以通过特定自然但超分布输入激活——是一个受到相对有限关注的重要问题。语义后门比基于触发模式的后门更难检测,因为缺乏明确可识别的模式。我们在假设干净训练数据集和训练配方均为已知的情况下解决此问题。这些假设源于消费者保护场景,即负责当局对机器学习服务提供商进行神秘购物测试。在该场景下,当局使用提供商的资源和工具在给定数据集上训练模型,并测试提供商是否包含后门。在我们提出的方法中,当局通过在受信任基础设施上训练少量干净和受污染模型来创建参考模型池,并校准模型距离阈值以识别干净模型。我们提出并实验分析了多种计算模型距离的方法,也测试了提供商执行自适应攻击以规避检测的情形。最可靠的方法基于要求提供商进行对抗训练。通过以最大化干净样本距离的方式对模型进行逆转以生成输入样本来度量模型距离。在这些设置下,我们的方法能够常常完全分离干净和受污染模型,并且在各种最先进的后门检测器方面证明优于它们。

关键词

引用

@article{arxiv.2601.03805,
  title  = {Detecting Semantic Backdoors in a Mystery Shopping Scenario},
  author = {Arpad Berta and Gabor Danner and Istvan Hegedus and Mark Jelasity},
  journal= {arXiv preprint arXiv:2601.03805},
  year   = {2026}
}

备注

Source code available at https://github.com/szegedai/SemanticBackdoorDetection