中文

通过对抗微调实现目标检测中的后门防御

计算机视觉与模式识别 2026-05-08 v1 密码学与安全

摘要

后门攻击可在保持干净数据性能的同时植入恶意行为,构成对安全关键视觉系统的严重威胁。虽然后门防御在图像分类方面已广泛研究,但针对目标检测的防御仍相对不成熟。对抗微调是图像分类中常见的后门防御方法,但将其应用于目标检测并非易事,因为以分类为导向的对抗生成方法不匹配目标检测的攻击空间——攻击可能导致目标误分类或消失,而标准检测损失会在许多预测结果中稀释修复信号。我们通过针对目标检测的对抗微调框架解决了这些挑战,仅凭受害者可访问的受损检测器和小量干净数据集(无需了解攻击目标)即可缓解目标检测后门。对于无需攻击目标知识的对抗生成,我们引入软分支最小化,利用软门组合与误分类和消失攻击一致的目标,以及基于检测的分类损失最大化。对于有针对性的修复,我们引入双目标微调损失应用于与目标匹配的预测,将防御性更新集中于与后门行为最相关的预测上。实验表明,我们的方法在CNN和Transformer基检测器上更有效地降低了攻击成功率,同时保持真实检测,优于基于分类的方法,且保持竞争的干净检测性能。

关键词

引用

@article{arxiv.2605.05928,
  title  = {Backdoor Mitigation in Object Detection via Adversarial Fine-Tuning},
  author = {Kealan Dunnett and Reza Arablouei and Dimity Miller and Volkan Dedeoglu and Raja Jurdak},
  journal= {arXiv preprint arXiv:2605.05928},
  year   = {2026}
}