中文

解释未见之物:面向地下矿山灾害情境感知的多模态视觉-语言推理

计算机视觉与模式识别 2025-12-11 v1

摘要

地下矿山灾害会产生弥漫的黑暗、粉尘与坍塌,严重遮挡视线,使人类与常规系统难以获得情境感知。为解决这一问题,我们提出 MDSE(Multimodal Disaster Situation Explainer,多模态灾害情境解释器),一种新颖的视觉-语言框架,可自动生成灾后地下场景的详细文本解释。MDSE 具有三项创新:(i) 上下文感知的交叉注意力机制,即使在严重退化条件下也能实现视觉与文本特征的稳健对齐;(ii) 分割感知的双通路视觉编码,融合全局与区域特定的嵌入表示;(iii) 资源高效的基于 Transformer 的语言模型,以极低的计算开销生成富有表现力的描述。为支持该任务,我们构建了 Underground Mine Disaster(UMD)数据集——首个真实地下灾害场景的图像-描述语料库,从而支持严格的训练与评估。在 UMD 及相关基准上的大量实验表明,MDSE 显著优于当前最先进的描述生成模型,能够生成更准确且上下文相关的描述,捕捉到被遮挡环境中的关键细节,从而提升地下应急响应的情境感知能力。代码见 https://github.com/mizanJewel/Multimodal-Disaster-Situation-Explainer。

关键词

引用

@article{arxiv.2512.09092,
  title  = {Explaining the Unseen: Multimodal Vision-Language Reasoning for Situational Awareness in Underground Mining Disasters},
  author = {Mizanur Rahman Jewel and Mohamed Elmahallawy and Sanjay Madria and Samuel Frimpong},
  journal= {arXiv preprint arXiv:2512.09092},
  year   = {2025}
}