中文

利用微调注意力架构进行航拍洪水场景分类,适用于南亚洪水易发国家

计算机视觉与模式识别 2024-11-04 v1

摘要

南亚国家经常经历许多灾难性洪水事件。通过图像分类,可以对洪水区域(包括房屋和人类)进行分类,从而加速搜救行动。我们创建了一个新的数据集,收集南亚各国洪水事件的航拍图像。在分类方面,我们提出了一种微调的紧凑卷积Transformer(CCT)方法以及其他前沿的基于Transformer和卷积神经网络(CNN)的架构。我们还实现了YOLOv8目标检测模型,在所提出数据集的图像中检测房屋和人类,然后将其性能与基于分类的方法进行比较。由于南亚各国具有相似的地形、房屋结构、洪水水的颜色和植被,这项工作比世界其他地区更适用于此类区域。图像被均匀地分为四类:'洪水'、'有房屋的洪水'、'有人类的洪水'和'无洪水'。在我们微调的CCT模型上对所提出的数据集进行实验后,该模型相比许多其他为计算机视觉设计的基于Transformer的架构具有较少的权重参数,表现出98.62%的准确率和98.50%的宏平均精确度。我们实现的其他基于Transformer的架构包括视觉Transformer(ViT)、Swin Transformer和外部注意力Transformer(EANet),分别给出88.66%、84.74%和66.56%的准确率。我们还实现了DCECNN(深度定制集成卷积神经网络),这是我们通过组合MobileNet、InceptionV3和EfficientNetB0创建的定制集成模型,获得了98.78%的准确率。我们实现的架构经过微调以在数据集上达到最佳性能。

关键词

引用

@article{arxiv.2411.00169,
  title  = {Aerial Flood Scene Classification Using Fine-Tuned Attention-based Architecture for Flood-Prone Countries in South Asia},
  author = {Ibne Hassan and Aman Mujahid and Abdullah Al Hasib and Andalib Rahman Shagoto and Joyanta Jyoti Mondal and Meem Arafat Manab and Jannatun Noor},
  journal= {arXiv preprint arXiv:2411.00169},
  year   = {2024}
}