PunchBench:多模态笑点理解的多模态大语言模型基准
计算机视觉与模式识别
2025-06-18 v2 人工智能
摘要
多模态笑点(通过图像-标题对传达幽默或讽刺)是在线多媒体平台上流行的交流方式。随着多模态大语言模型的快速发展,评估其有效理解这些笑点的能力至关重要。然而,现有的笑点理解基准存在三个主要局限:1)语言捷径使模型仅依赖文本;2)缺乏问题多样性;3)仅聚焦于多模态内容的特定领域(如卡通)。为解决这些局限,我们引入了一个多模态笑点理解基准,命名为PunchBench,专为准确且全面地评估笑点理解而设计。为提升评估准确性,我们通过修改原始标题生成同义和反义标题,以减轻标题中捷径的影响。为提供全面评估,PunchBench包含了多样的问题格式和来自不同领域的图像-标题对。在此基础上,我们进行了广泛评估,揭示了最先进的多模态大语言模型与人类在笑点理解上的显著差距。为提升笑点理解,我们提出了简单到复杂的问题链策略,使模型能够通过先掌握简单问题逐步解决复杂问题。该策略有效提升了多种多模态大语言模型在PunchBench上的性能,超越了上下文学习和思维链。
引用
@article{arxiv.2412.11906,
title = {PunchBench: Benchmarking MLLMs in Multimodal Punchline Comprehension},
author = {Kun Ouyang and Yuanxin Liu and Shicheng Li and Yi Liu and Hao Zhou and Fandong Meng and Jie Zhou and Xu Sun},
journal= {arXiv preprint arXiv:2412.11906},
year = {2025}
}
备注
This is the camera-ready version for ACL 2025