中文

基于视觉Transformer检测器(ViTDet)的航拍图像目标检测

计算机视觉与模式识别 2023-02-03 v2

摘要

过去几年,由于航拍图像目标检测对大规模地球科学研究(如环境研究、城市规划和情报监测)的关键价值,人们对其兴趣日益增加。然而,由于鸟瞰视角、复杂背景、大而多样的图像尺寸、物体外观各异以及标注良好数据集的稀缺,该任务极具挑战性。计算机视觉的最新进展为应对这一挑战带来了希望。具体而言,视觉Transformer检测器(ViTDet)被提出用于提取多尺度特征以进行目标检测。实证研究表明,ViTDet 的简单设计在自然场景图像上取得了良好性能,并且可以轻松嵌入到任何检测器架构中。迄今为止,ViTDet 对具有挑战性的航拍图像目标检测的潜在益处尚未被探索。因此,在我们的研究中,进行了 25 组实验,在三个知名数据集上评估 ViTDet 用于航拍图像目标检测的有效性:Airbus Aircraft、RarePlanes 和航拍图像目标检测数据集(DOTA)。我们的结果表明,ViTDet 在水平边界框(HBB)目标检测上以较大优势(平均精度上最高达 17%)持续优于其卷积神经网络对应方法,并且在定向边界框(OBB)目标检测上取得了具有竞争力的性能。我们的结果也为未来研究建立了基线。

关键词

引用

@article{arxiv.2301.12058,
  title  = {Aerial Image Object Detection With Vision Transformer Detector (ViTDet)},
  author = {Liya Wang and Alex Tien},
  journal= {arXiv preprint arXiv:2301.12058},
  year   = {2023}
}