VLCE:一种用于灾害评估图像描述的知识增强框架
计算机视觉与模式识别
2026-03-11 v6 机器学习
摘要
诸如 LLaVA 和 QwenVL 等通用视觉语言模型(VLM)在生成灾害图像描述时,缺乏领域特定词汇与可操作的细节。我们提出了视觉语言描述增强器(VLCE),这是一个将来自 ConceptNet 和 WordNet 的外部语义知识集成到灾后卫星及无人机(UAV)图像描述生成过程中的框架。VLCE 分为两个阶段运行:首先,基线 VLM 在 YOLOv8 目标检测的条件下生成初始描述;其次,一个知识增强的序列模型(CNN-LSTM 或分层跨模态 Transformer)利用从知识图谱中提取的 1,566 个领域相关术语扩充后的词汇表来优化描述。我们在两个灾害基准数据集上评估了 VLCE:xBD(卫星,6,369 张图像,3 个损伤类别)和 RescueNet(UAV,4,494 张图像,12 个损伤类别),使用 CLIPScore 评估语义对齐,使用 InfoMetIC 评估信息量。在 RescueNet 上使用 Transformer 解码器时,带有知识图谱增强的 VLCE 在 InfoMetIC 上有 95.33% 的图像对、在 CLIPScore 上有 73.64% 的图像对中,其生成的描述优于 QwenVL 基线。定性分析表明,若不进行知识图谱集成,生成的描述会出现幻觉、词语重复和语义不连贯,而知识增强的描述则能保持事实一致性及领域适用词汇。
引用
@article{arxiv.2509.21609,
title = {VLCE: A Knowledge-Enhanced Framework for Image Description in Disaster Assessment},
author = {Md. Mahfuzur Rahman and Kishor Datta Gupta and Marufa Kamal and Fahad Rahman and Sunzida Siddique and Ahmed Rafi Hasan and Mohd Ariful Haque and Roy George},
journal= {arXiv preprint arXiv:2509.21609},
year = {2026}
}
备注
28 pages, 30 figures, 1 algorithms