中文

揭开仇恨内容的面纱:利用大型多模态模型进行仇恨表情包检测与可解释决策

计算与语言 2025-02-18 v1

摘要

仇恨表情包检测作为一项多模态任务,面临解读表情包中隐含仇恨信息和上下文线索的复杂性挑战。此前方法对预训练视觉语言模型(PT-VLMs)进行微调,利用预训练获得的知识和注意力机制来理解表情包内容。然而,这些模型对隐含知识和复杂注意力机制的依赖使其决策难以解释,而这对建立表情包分类的信任至关重要。本文提出 IntMeme,一个利用大型多模态模型(LMMs)进行仇恨表情包分类并具有可解释决策的新框架。IntMeme 应对了提高准确性和可解释性的双重挑战。该框架利用 LMMs 生成类人、可解释的表情包分析,提供对多模态内容和上下文的更深层洞察。此外,它使用独立的编码模块分别处理表情包及其解读,然后进行组合以提升分类性能。本方法解决了 PT-VLMs 相关的黑箱问题和误分类问题,优化了 LMMs 在仇恨表情包检测中的应用。通过在三个数据集上的全面实验验证了 IntMeme 的有效性,展示了其优于最先进模型的性能。

关键词

引用

@article{arxiv.2502.11073,
  title  = {Demystifying Hateful Content: Leveraging Large Multimodal Models for Hateful Meme Detection with Explainable Decisions},
  author = {Ming Shan Hee and Roy Ka-Wei Lee},
  journal= {arXiv preprint arXiv:2502.11073},
  year   = {2025}
}

备注

Preprint. Accepted at ICWSM'25