中文

跨模态理由传递:社交媒体上可解释人道主义分类

计算与语言 2026-03-20 v1 计算机视觉与模式识别

摘要

社交媒体数据 dissemination 的 advances 使我们能够在危机发生时提供实时信息。这些信息来自不同的类别,如基础设施损坏、失踪者或被困人员等。在危机相关的图像方面,现有方法尝试将文本和图像分类到各种人道主义类别,但其决策过程仍基本不透明,这影响了其在现实应用中的部署。最近的工作试图通过从推文中提取文本理由来提高透明度,但可解释分类方法大多关注文本而非危机相关图像。本文提出一种以可解释为设计的多模态分类框架。该方法首先学习文本和图像的联合表示,提取文本理由。随后,通过文本理由的映射提取图像理由。我们的做法展示了如何通过跨模态理由传递在一个模态中从另一个模态中学习理由,从而节省标注工作。最后,对推文进行分类。我们在 CrisisMMD 数据集上进行实验,结果表明,我们的方法在提取准确的文本标记和图像块作为理由的同时,将分类 Macro-F1 提升了 2-35%。人类评估也支持我们的方法能够检索出更好的图像理由块(提高 12%),帮助识别人道主义类别。我们的方法在零样本模式下适配新的、未见的数据集,准确率可达 80%。

关键词

引用

@article{arxiv.2603.18611,
  title  = {Cross-Modal Rationale Transfer for Explainable Humanitarian Classification on Social Media},
  author = {Thi Huyen Nguyen and Koustav Rudra and Wolfgang Nejdl},
  journal= {arXiv preprint arXiv:2603.18611},
  year   = {2026}
}

备注

Accepted at WWW 2026