Out-of-the-box:针对目标检测器的黑盒因果攻击
计算机视觉与模式识别
2026-04-13 v2 人工智能
摘要
对抗扰动是暴露目标检测器漏洞的有效方法。现有扰动方法常为白盒、针对特定网络结构,并使用损失函数。更重要的是,虽然这些方法往往成功,但鲜有人清楚其工作原理。洞察这些攻击的机制有助于开发者理解和分析这些攻击,同时微调模型以防御。本文提出 BlackCAtt,一种黑盒算法和工具,通过利用最小且因果充分的像素集合构建可解释、难以察觉且可复现的、无网络结构依赖性的攻击。我们在标准基准数据集上评估 BlackCAtt,并与其他黑盒对抗攻击方法进行比较。实验结果表明:当 BlackCAtt 仅访问目标框的位置和标签信息时,所产生的攻击与其他黑盒方法相当或更优;当 BlackCAtt additionally 访问模型置信度时,可作为元算法使用,提高标准黑盒技术构建更小、更难以察觉攻击的能力。由于 BlackCAtt 的攻击仅操作因果像素,攻击过程完全可解释。我们比较 BlackCAtt 与其他黑盒攻击方法的性能,表明以因果像素为目标可实现更小、更难以察觉的攻击。例如,使用 BlackCAtt 对 SquareAttack 的攻击将平均距离 ( 范数) 从原始输入的 0.987 降至 0.072,同时保持相似的成功率。我们对 BlackCAtt 算法进行消除实验,分析各组成部分对性能的影响。
引用
@article{arxiv.2512.03730,
title = {Out-of-the-box: Black-box Causal Attacks on Object Detectors},
author = {Melane Navaratnarajah and David A. Kelly and Hana Chockler},
journal= {arXiv preprint arXiv:2512.03730},
year = {2026}
}
备注
14 pages, 12 pages of appendices