中文

D-HUMOR:基于多模态开放式推理的黑色幽默理解——基准数据集与方法

计算机视觉与模式识别 2025-10-31 v2

摘要

网络迷因中的黑色幽默由于其依赖隐含、敏感和具有文化背景的线索而带来独特的挑战。为了解决多模态内容中黑色幽默检测的资源和方法缺乏的问题,我们引入了一个包含 4,379 个 Reddit 迷因的新颖数据集,并对其进行了黑色幽默、目标类别(性别、心理健康、暴力、种族、残疾及其他)以及三级强度评级(轻度、中度、严重)的标注。在此资源的基础上,我们提出了一个推理增强框架,该框架首先使用大型视觉语言模型(VLM)为每个迷因生成结构化解释。通过角色互换自循环,VLM 采用作者视角迭代地精炼其解释,以确保完整性和一致性。随后,我们通过文本编码器从 OCR 转录文本和自精炼推理中提取文本特征,同时使用视觉 transformer 获取视觉特征。三流交叉推理网络(TCRNet)通过成对注意力机制融合文本、图像和推理这三个流,产生用于分类的统一表示。实验结果表明,我们的方法在黑色幽默检测、目标识别和强度预测这三个任务上均优于强基线。数据集、标注和代码已发布,以促进多模态幽默理解和内容审核的进一步研究。代码和数据集可在以下地址获取:https://github.com/Sai-Kartheek-Reddy/D-Humor-Dark-Humor-Understanding-via-Multimodal-Open-ended-Reasoning

关键词

引用

@article{arxiv.2509.06771,
  title  = {D-HUMOR: Dark Humor Understanding via Multimodal Open-ended Reasoning -- A Benchmark Dataset and Method},
  author = {Sai Kartheek Reddy Kasu and Mohammad Zia Ur Rehman and Shahid Shafi Dar and Rishi Bharat Junghare and Dhanvin Sanjay Namboodiri and Nagendra Kumar},
  journal= {arXiv preprint arXiv:2509.06771},
  year   = {2025}
}

备注

Accepted at IEEE International Conference on Data Mining (ICDM) 2025