中文

MemeMind:用于有害表情包检测的大规模多模态数据集与链式思考推理

计算与语言 2026-04-02 v4 人工智能 计算机视觉与模式识别

摘要

作为结合图像和文本的多模态媒介,表情包经常通过隐喻和幽默传递隐含的有害内容,使其检测成为一个复杂且具挑战性的任务。尽管近期研究在检测准确率和可解释性方面取得了进展,但大规模、高质量的有害表情包数据集仍稀缺,现有方法仍难以捕捉隐式风险和细腻语义。因此,我们构建了 MemeMind,一个大规模有害表情包数据集。符合国际标准和互联网背景的 MemeMind 提供详细的链式思考(CoT)推理注释,以支持对表情包中隐含意图的细粒度分析。基于该数据集,我们进一步提出了 MemeGuard,一个面向推理的多模态检测框架,显著提高了有害表情包检测的准确率和模型决策的可解释性。大量实验结果表明,MemeGuard 在 MemeMind 数据集上超越了现有的国家级方法,为未来的有害表情包检测研究奠定了坚实的基础。完整数据集和代码将在接受后发布。

关键词

引用

@article{arxiv.2506.18919,
  title  = {MemeMind: A Large-Scale Multimodal Dataset with Chain-of-Thought Reasoning for Harmful Meme Detection},
  author = {Hexiang Gu and Qifan Yu and Yuan Liu and Zikang Li and Saihui Hou and Jian Zhao and Zhaofeng He},
  journal= {arXiv preprint arXiv:2506.18919},
  year   = {2026}
}