中文

通过描述和视觉问答检测与理解 meme 中的仇恨内容

计算机视觉与模式识别 2025-04-24 v1 人工智能

摘要

meme 广泛用于幽默和文化评论,但日益被用于传播仇恨内容。由于其多模态特性,仇恨 meme 常常能规避仅基于文本或仅基于图像的检测系统,尤其当它们运用含蓄或编码性引用时。为应对这些挑战,我们提出一种多模态仇恨检测框架,集成关键组件:OCR 用于提取嵌入文本、描述生成用于中性描述视觉内容、子标签分类用于细粒度仇恨内容分类、RAG 用于上下文相关检索、VQA 用于迭代分析象征性和上下文线索。这一机制使我们能够发现较简单管道难以检测的潜在信号。在 Facebook Hateful Memes 数据集上的实验结果表明,所提框架在准确率和 AUC-ROC 上均优于单模态和传统多模态模型。

关键词

引用

@article{arxiv.2504.16723,
  title  = {Detecting and Understanding Hateful Contents in Memes Through Captioning and Visual Question-Answering},
  author = {Ali Anaissi and Junaid Akram and Kunal Chaturvedi and Ali Braytee},
  journal= {arXiv preprint arXiv:2504.16723},
  year   = {2025}
}

备注

13 pages, 2 figures, 2025 International Conference on Computational Science