迈向高性能目标检测器:基于 ViT 与 CNN 深度学习模型的无人机检测洞见
计算机视觉与模式识别
2023-09-19 v2 机器人学
摘要
在无人机避撞、无人机防御与自主无人 aerial 飞行器(UAV)自着陆中,准确的无人机检测需求迫切。随着视觉 Transformer(ViT)近期的出现,本文利用由 1359 张无人机照片组成的 UAV 数据集重新评估了这一关键任务。我们构建了多种 CNN 与基于 ViT 的模型,表明对于单无人机检测,基础 ViT 的鲁棒性可达我们最佳基于 CNN 的迁移学习模型的 4.6 倍。通过在多无人机检测中部署最先进的 You Only Look Once(YOLO v7,200 轮)与实验性的基于 ViT 的 You Only Look At One Sequence(YOLOS,20 轮),我们分别取得了令人印象深刻的 98% 与 96% mAP 值。我们发现 ViT 在相同轮数下优于 CNN,但也需要更多训练数据、计算力与精细的、面向性能的设计以完全超越尖端 CNN 检测器的能力。我们总结了 ViT 与 CNN 模型的显著差异特性,以助未来研究者开发更高效的深度学习模型。
引用
@article{arxiv.2308.09899,
title = {Towards a High-Performance Object Detector: Insights from Drone Detection Using ViT and CNN-based Deep Learning Models},
author = {Junyang Zhang},
journal= {arXiv preprint arXiv:2308.09899},
year = {2023}
}
备注
7 pages, 23 figures, IEEE Xplore, 2023 International Conference on Computer Vision and Robotics Science