TPH-YOLOv5:基于 Transformer 预测头改进的 YOLOv5 及其在无人机捕获场景下的目标检测
计算机视觉与模式识别
2021-08-31 v1 人工智能
摘要
无人机捕获场景下的目标检测是近期热门的任务。由于无人机总是在不同高度飞行,目标尺度变化剧烈,这增加了网络优化的负担。此外,高速和低空飞行会在密集排列的物体上带来运动模糊,给目标区分带来巨大挑战。为了解决上述两个问题,我们提出了 TPH-YOLOv5。在 YOLOv5 的基础上,我们增加了一个预测头来检测不同尺度的物体。然后,我们用 Transformer Prediction Heads (TPH) 替换原有的预测头,以通过自注意力机制探索预测潜力。我们还集成了卷积块注意力模型 (CBAM),以在物体密集的场景中寻找注意力区域。为了进一步提升所提出的 TPH-YOLOv5 的性能,我们提供了一系列有用的策略,如数据增强、多尺度测试、多模型集成和利用额外分类器。在 VisDrone2021 数据集上的大量实验表明,TPH-YOLOv5 在无人机捕获场景中表现良好,并具有出色的可解释性。在 DET-test-challenge 数据集上,TPH-YOLOv5 的 AP 结果为 39.18%,比之前的 SOTA 方法 (DPNetV3) 提高了 1.81%。在 VisDrone Challenge 2021 中,TPH-YOLOv5 获得第 5 名,并与第 1 名模型(AP 39.43%)取得了相匹配的结果。与基线模型 (YOLOv5) 相比,TPH-YOLOv5 提升了约 7%,令人鼓舞且极具竞争力。
引用
@article{arxiv.2108.11539,
title = {TPH-YOLOv5: Improved YOLOv5 Based on Transformer Prediction Head for Object Detection on Drone-captured Scenarios},
author = {Xingkui Zhu and Shuchang Lyu and Xu Wang and Qi Zhao},
journal= {arXiv preprint arXiv:2108.11539},
year = {2021}
}
备注
8 pages,9 figures, VisDrone 2021 ICCV workshop