探究检测Transformer (DETR) 对困难图像的鲁棒性与特性
计算机视觉与模式识别
2023-10-16 v1
摘要
基于Transformer的目标检测器 (DETR) 在机器视觉任务(尤其是目标检测)中展现出显著的性能。该检测器基于自注意力机制以及Transformer编码器-解码器架构来捕获图像的全局上下文。需要解决的关键问题在于该模型架构如何处理不同的图像干扰,例如遮挡和对抗扰动。我们通过不同的实验测量DETR的性能,并将其与基于卷积神经网络 (CNN) 的检测器(如YOLO和Faster-RCNN)进行基准对比来研究此问题。我们发现,在抵抗遮挡图像中信息丢失的干扰方面,DETR表现良好。尽管如此,我们发现图像上贴的对抗贴纸要求网络产生一组新的不必要的键、查询和值,这在大多数情况下会导致网络误导向。在图像损坏基准测试中,DETR的表现也劣于YOLOv5。此外,我们发现DETR在做出预测时严重依赖主查询,这导致查询之间的贡献不平衡,因为主查询接收了大部分的梯度流。
引用
@article{arxiv.2310.08772,
title = {Investigating the Robustness and Properties of Detection Transformers (DETR) Toward Difficult Images},
author = {Zhao Ning Zou and Yuhang Zhang and Robert Wijaya},
journal= {arXiv preprint arXiv:2310.08772},
year = {2023}
}