中文

BanglaMM-Disaster:基于多模态 Transformer 的 Bangla 多类别灾害分类深度学习框架

机器学习 2025-11-27 v1 计算机视觉与模式识别

摘要

自然灾害始终是孟加拉国面临的主要挑战,因此实时监控和快速响应系统至关重要。本研究提出了 BanglaMM-Disaster,一个用于 Bangla 语言灾害分类的端到端深度学习多模态框架,利用社交媒体中的文本和视觉数据。我们构建了一个包含 5037 篇 Bangla 社交媒体帖子的数据集,每篇帖子包含标题和对应的图像,并标注为九个灾害相关类别中的一个。该模型将基于 Transformer 的文本编码器,包括 BanglaBERT、mBERT 和 XLM-RoBERTa,与 CNN 主干网络如 ResNet50、DenseNet169 和 MobileNetV2 结合,用于处理两种模态。采用早期融合方法,最佳模型实现了 83.76% 的准确率。这超过了最佳仅文本基线的 3.84%,并超过了仅图像基线的 16.91%。我们的分析还显示了所有类别的误分类率降低,在模糊示例方面有显著改善。这一工作填补了 Bangla 多模态灾害分析的关键空白,展示了在资源有限的环境中结合多种数据类型为实时灾害响应所带来的优势。

关键词

引用

@article{arxiv.2511.21364,
  title  = {BanglaMM-Disaster: A Multimodal Transformer-Based Deep Learning Framework for Multiclass Disaster Classification in Bangla},
  author = {Ariful Islam and Md Rifat Hossen and Md. Mahmudul Arif and Abdullah Al Noman and Md Arifur Rahman},
  journal= {arXiv preprint arXiv:2511.21364},
  year   = {2025}
}

备注

Presented at the 2025 IEEE International Conference on Signal Processing, Information, Communication and Systems (SPICSCON), November 21-22, 2025, University of Rajshahi, Bangladesh. 6 pages, 9 disaster classes, multimodal dataset with 5,037 samples