中文

面向多模态精神健康表情包分类的隐喻式与常识知识融合

计算与语言 2025-01-28 v1 社会与信息网络

摘要

通过非传统方式表达精神健康症状的手段,如表情包,近年来受到广泛关注,用户常通过表情包中的隐喻细节来凸显自己的精神健康挑战。尽管人类依赖常识知识来解读这些复杂表达,但当前的多模态语言模型 (Multimodal Language Models, MLMs) 难以捕捉表情包中固有的隐喻性质。为填补这一差距,我们引入了一个新数据集 AxiOM,源自 GAD 焦虑问卷,将表情包分为六个细粒度焦虑症状。接着,我们提出一种常识与领域丰富化框架 M3H,以增强 MLMs 对隐喻语言和常识知识的解读能力。总体目标始终是 first understand and then classify 表达于表情包中的精神健康症状。我们将 M3H 与 6 个竞争基线 (共 20 种变体) 进行基准测试,在定量与定性指标上均实现改进,包括详细的人类评估。我们观察到在加权-F1 指标上分别实现 4.20% 和 4.66% 的提升。为评估其泛化性,我们在公共数据集 RESTORE 上进行大量实验,对 depressive symptom identification 进行扩展,并进行详尽的消融研究,凸显每个模块在两个数据集中的贡献。我们的发现揭示了现有模型的局限性以及运用常识知识来增强隐喻理解的优势。

关键词

引用

@article{arxiv.2501.15321,
  title  = {Figurative-cum-Commonsense Knowledge Infusion for Multimodal Mental Health Meme Classification},
  author = {Abdullah Mazhar and Zuhair hasan shaik and Aseem Srivastava and Polly Ruhnke and Lavanya Vaddavalli and Sri Keshav Katragadda and Shweta Yadav and Md Shad Akhtar},
  journal= {arXiv preprint arXiv:2501.15321},
  year   = {2025}
}

备注

Accepted for oral presentation at The Web Conference (WWW) 2025