结合空间金字塔池化的 YOLOv3 用于无人机目标检测
计算机视觉与模式识别
2023-05-23 v1
摘要
无人机(Unmanned Aerial Vehicles, UAVs)目标检测在计算机视觉研究领域引起了广泛关注。然而,利用无人机获取的数据进行准确的目标检测并非易事,因为无人机从极高处拍摄图像,导致图像以难以检测的小尺寸目标为主。受此挑战启发,我们旨在通过在主干网络 darknet-53 末端添加空间金字塔池化(Spatial Pyramid Pooling, SPP)层,以在无人机目标检测任务中获得更高效的特征提取过程,从而提升单阶段检测器 YOLOv3 的性能。我们还在 VisDrone2019-Det 数据集上对不同版本的 YOLOv3 方法进行了评估研究,包括加入 SPP 的 YOLOv3、YOLOv3 和 YOLOv3-tiny。结果表明,在 640x640 输入尺度下,加入 SPP 的 YOLOv3 的 mAP 比 YOLOv3 高 0.6%,比 YOLOv3-Tiny 高 26.6%,并且与其他版本的 YOLOv3 方法相比,它甚至能够在不同的输入图像尺度下保持准确率。这些结果证明,在 YOLOv3 中添加 SPP 层是提升基于无人机数据的目标检测方法性能的有效解决方案。
引用
@article{arxiv.2305.12344,
title = {YOLOv3 with Spatial Pyramid Pooling for Object Detection with Unmanned Aerial Vehicles},
author = {Wahyu Pebrianto and Panca Mudjirahardjo and Sholeh Hadi Pramono and Rahmadwati and Raden Arief Setyawan},
journal= {arXiv preprint arXiv:2305.12344},
year = {2023}
}