CrisisViT:一种用于危机图像分类的鲁棒视觉 Transformer
计算机视觉与模式识别
2024-01-08 v1 人工智能
多媒体
社会与信息网络
摘要
在紧急情况下,危机响应机构需要快速准确地评估实地情况,以便部署相关的服务和资源。然而,当局往往不得不基于有限的信息做出决策,因为在当地响应服务提供第一手报告之前,受灾地区的数据可能非常稀缺。幸运的是,配备高质量摄像头的智能手机的普及使得通过社交媒体进行的公民新闻成为危机响应者宝贵的信息来源。然而,分析公民发布的大量图像所需的时间和精力通常超出了可用范围。为了解决这个问题,本文提出利用最先进的深度神经模型进行自动图像分类/标记,具体是通过调整基于 Transformer 的架构用于危机图像分类(CrisisViT)。我们利用新的 Incidents1M 危机图像数据集开发了一系列新的基于 Transformer 的图像分类模型。通过在标准危机图像基准数据集上进行实验,我们证明 CrisisViT 模型在紧急类型、图像相关性、人道主义类别和损害严重程度分类方面显著优于以前的方法。此外,我们展示了新的 Incidents1M 数据集可以进一步增强 CrisisViT 模型,带来额外的 1.25\% 绝对准确率提升。
引用
@article{arxiv.2401.02838,
title = {CrisisViT: A Robust Vision Transformer for Crisis Image Classification},
author = {Zijun Long and Richard McCreadie and Muhammad Imran},
journal= {arXiv preprint arXiv:2401.02838},
year = {2024}
}