用于多模态危机事件分析的差分注意力机制
计算机视觉与模式识别
2025-07-08 v1
摘要
社交网络在危机事件中可以成为有价值的信息来源。特别是,用户可以发布多模态数据流,这对于实时人道主义响应至关重要。然而,从这种庞大且嘈杂的数据流中有效提取有意义的信息并有效整合异构数据仍然是一个严峻的挑战。在这项工作中,我们探索了视觉语言模型 (VLM) 和先进的融合策略,以增强三个不同任务中危机数据的分类。我们结合 LLaVA 生成的文本来改善文本-图像对齐。此外,我们利用基于对比语言-图像预训练 (CLIP) 的视觉和文本嵌入,在没有任务特定微调的情况下,其性能优于传统模型。为了进一步优化多模态融合,我们采用了引导交叉注意力 (Guided CA),并将其与差分注意力机制相结合,通过强调关键信息同时过滤掉不相关内容来增强特征对齐。我们的结果表明,虽然差分注意力提高了分类性能,但引导交叉注意力在对齐多模态特征方面仍然非常有效。在 CrisisMMD 基准数据集上进行的大量实验表明,预训练 VLM、丰富的文本描述和自适应融合策略的组合在分类准确率上持续优于最先进的模型,为灾难响应至关重要的三个不同任务贡献了更可靠和可解释的模型。我们的代码可在 https://github.com/Munia03/Multimodal_Crisis_Event 获取。
引用
@article{arxiv.2507.05165,
title = {Differential Attention for Multimodal Crisis Event Analysis},
author = {Nusrat Munia and Junfeng Zhu and Olfa Nasraoui and Abdullah-Al-Zubaer Imran},
journal= {arXiv preprint arXiv:2507.05165},
year = {2025}
}
备注
Presented at CVPRw 2025, MMFM3