Hummus:幽默多模态隐喻用法数据集
计算与语言
2026-01-21 v2 计算机视觉与模式识别
摘要
隐喻与幽默在很大程度上共享共同的领域,隐喻是最常见的幽默机制之一。本研究聚焦于多模态隐喻的幽默能力,这一在学术社区中受到 insufficient 注意。我们借鉴幽默不协调论、概念隐喻理论以及 VU 阿姆斯特丹隐喻语料库的标注方案,开发了一种用于图像-标题对中幽默多模态隐喻使用的新标注方案。我们创建了 Hummus 幽默多模态隐喻用法数据集,提供对来自纽约客标题竞赛语料库中抽取的 1000 组图像-标题对的专家标注。使用该数据集,我们测试了最先进的多模态大语言模型(MLLM)在检测和理解幽默多模态隐喻方面的能力。我们的实验表明,当前的 MLLM 在处理幽默多模态隐喻方面仍存在挑战,尤其是在整合视觉和文本信息方面。我们在 github.com/xiaoyuisrain/humorous-multimodal-metaphor-use 上发布了数据集和代码。
引用
@article{arxiv.2504.02983,
title = {Hummus: A Dataset of Humorous Multimodal Metaphor Use},
author = {Xiaoyu Tong and Zhi Zhang and Pia Sommerauer and Martha Lewis and Ekaterina Shutova},
journal= {arXiv preprint arXiv:2504.02983},
year = {2026}
}