中文

目标检测模型的测试时后门检测

计算机视觉与模式识别 2025-03-20 v1

摘要

目标检测模型对后门攻击极其脆弱,攻击者通过在小 subset 的训练样本中嵌入预定义触发器来操控预测。可以在测试时检测含触发器的被污染样本,以防止后门激活。然而,与图像分类任务不同,目标检测的独特特征——尤其是其输出大量目标——为后门检测带来了新挑战。复杂的攻击效果(如"幽灵"对象出现或"消失"对象)进一步使当前防御方法根本不足。为此,我们设计了 TRAnsformation Consistency Evaluation(TRACE),一种用于目标检测测试时检测被污染样本的全新方法。我们的旅程始于两个有趣的观察:(1) 被污染的样本在 varied backgrounds across 上的检测结果显得更一致;(2) 清洁样本在引入 different focal information 时表现出更高的检测一致性。基于这些现象,TRACE 对每个测试样本应用前景和背景转换,然后通过计算 objects 置信度的方差来评估转换一致性。TRACE 实现了 black-box、通用的后门检测,经过大量实验表明其在 AUROC 上比最先进的防御方法提高了 30%,并能抵抗自适应攻击。

关键词

引用

@article{arxiv.2503.15293,
  title  = {Test-Time Backdoor Detection for Object Detection Models},
  author = {Hangtao Zhang and Yichen Wang and Shihui Yan and Chenyu Zhu and Ziqi Zhou and Linshan Hou and Shengshan Hu and Minghui Li and Yanjun Zhang and Leo Yu Zhang},
  journal= {arXiv preprint arXiv:2503.15293},
  year   = {2025}
}

备注

Accepted to CVPR 2025