中文

CrisisKAN:面向危机事件分类的知识注入与可解释多模态注意力网络

机器学习 2024-01-15 v1 人工智能 计算与语言

摘要

社交媒体的广泛使用已成为获取实时信息(如图像、文本或两者兼有)以识别各类事件的新兴来源。尽管基于图像和文本的事件分类发展迅速,但由于编码不一致,现有最先进(SOTA)模型在弥合图像与文本模态特征间的语义鸿沟方面仍面临挑战。此外,模型的黑盒特性无法解释其输出结果,从而难以在灾害、疫情等高风险情境下建立信任。另外,社交媒体帖子的字数限制可能会引入对特定事件的偏差。针对这些问题,我们提出了 CrisisKAN,一种新颖的知识注入与可解释多模态注意力网络,该网络结合图像、文本以及来自 Wikipedia 的外部知识来对危机事件进行分类。为了丰富对文本信息的上下文特定理解,我们使用所提出的 wiki 提取算法集成了 Wikipedia 知识。与此同时,我们实现了一个引导交叉注意力模块,以填补视觉与文本数据融合时的语义鸿沟。为了确保可靠性,我们采用了一种称为梯度加权类激活映射(Grad-CAM)的模型特定方法,为所提出模型的预测提供了稳健的解释。在 CrisisMMD 数据集上进行的综合实验在各种特定危机任务和设置下提供了深入分析。结果表明,CrisisKAN 优于现有的 SOTA 方法,并在可解释多模态事件分类领域提供了新视角。

关键词

引用

@article{arxiv.2401.06194,
  title  = {CrisisKAN: Knowledge-infused and Explainable Multimodal Attention Network for Crisis Event Classification},
  author = {Shubham Gupta and Nandini Saini and Suman Kundu and Debasis Das},
  journal= {arXiv preprint arXiv:2401.06194},
  year   = {2024}
}