中文

面向航空灾害识别的 Transformer 增强网络 DiRecNetV2

计算机视觉与模式识别 2024-10-18 v1

摘要

将无人机 (UAV) 与人工智能 (AI) 模型集成用于航空图像处理以进行灾害评估,要求模型在准确性、计算效率和实时处理能力方面表现卓越。传统卷积神经网络 (CNN) 在局部特征提取方面表现高效,但受限于其对全局上下文理解的潜在不足。另一方面,Vision Transformer (ViT) 由于采用注意力机制,展现出更好的全局上下文理解潜力,尽管在无人机基于灾害响应应用领域仍属探索不足。为弥补这一研究空白,我们引入了 DiRecNetV2,这是一个改进的混合模型,利用卷积和变换器层。它融合了 CNN 用于稳健特征提取的归纳偏置,以及 Transformer 用于全局上下文理解的能力,保持低计算负荷,适用于无人机应用。此外,我们引入了一个新的紧凑型多标签灾害数据集,以设定未来研究的初始基准,探索在单标签测试集上训练的模型在多标签测试集上的表现。该研究评估了轻量级 CNN 和 ViT 在 AIDERSv2 数据集上的性能,基于帧每秒 (FPS) 衡量效率,基于加权 F1 分数衡量分类性能。DiRecNetV2 不仅在单标签测试集上取得 0.964 的加权 F1 分数,还在复杂的多标签测试集上表现出适应性,得分为 0.614,同时在 Nvidia Orin Jetson 设备上以 176.13 FPS 的速度运行。

关键词

引用

@article{arxiv.2410.13663,
  title  = {DiRecNetV2: A Transformer-Enhanced Network for Aerial Disaster Recognition},
  author = {Demetris Shianios and Panayiotis Kolios and Christos Kyrkou},
  journal= {arXiv preprint arXiv:2410.13663},
  year   = {2024}
}

备注

23 pages