使用 Vision Transformers 进行 X 射线图像中的违禁物品检测
计算机视觉与模式识别
2025-02-14 v2
摘要
违禁物品检测是在机场、火车站、地铁站和港口等各种高安全级别地点执行的关键任务。每小时检查数千张 X 射线图像的持续且枯燥的工作可能会造成极大的精神负担。因此,深度神经网络可用于自动化 X 射线图像分析过程,提高效率并减轻安检人员的检查负担。相关文献中通常使用的神经架构是卷积神经网络,而很少采用 Vision Transformers (ViTs)。为了填补这一空白,本文对相关的 ViT 架构在 X 射线图像违禁物品检测中的表现进行了全面评估。本研究使用了 Transformer 和混合骨干网络(如 SWIN 和 NextViT)以及检测器(如 DINO 和 RT-DETR)。结果证明了 DINO Transformer 检测器在低数据情况下的卓越准确性、YOLOv8 令人印象深刻的实时性能以及混合 NextViT 骨干网络的有效性。
引用
@article{arxiv.2403.19043,
title = {Illicit object detection in X-ray images using Vision Transformers},
author = {Jorgen Cani and Ioannis Mademlis and Adamantia Anna Rebolledo Chrysochoou and Georgios Th. Papadopoulos},
journal= {arXiv preprint arXiv:2403.19043},
year = {2025}
}