当“YES”遇见“BUT”:大模型能否通过对比推理理解矛盾幽默?
计算机视觉与模式识别
2026-04-16 v2 计算与语言
摘要
理解幽默——特别是当它涉及需要对比推理的复杂、矛盾的叙事时——对于大型视觉语言模型(VLM)仍然是一个重大挑战。这一限制阻碍了AI进行类人推理和文化表达的能力。在本文中,我们通过对将面板并置以通过矛盾创造幽默的漫画进行深入分析来研究这一挑战。我们引入了YesBut (V2),一个包含来自不同多语言和多文化背景的1,262张漫画图像的新颖基准测试,具有捕获叙事理解各个方面的全面注释。使用此基准测试,我们通过四个互补任务系统地评估了广泛的VLM,这些任务从表面内容理解到深度叙事推理,特别强调矛盾元素之间的对比推理。我们广泛的实验表明,即使是最先进的模型也显著低于人类水平,在视觉感知、关键元素识别、对比分析和幻觉方面存在常见失败。我们进一步研究了基于文本的训练策略和社会知识增强方法以提高模型性能。我们的发现不仅突出了VLM在理解文化和创意表达方面的关键弱点,而且还提供了通过对比推理开发能够深度叙事理解的上下文感知模型的途径。
引用
@article{arxiv.2503.23137,
title = {When 'YES' Meets 'BUT': Can Large Models Comprehend Contradictory Humor Through Comparative Reasoning?},
author = {Tuo Liang and Zhe Hu and Jing Li and Hao Zhang and Yiren Lu and Yunlai Zhou and Yiran Qiao and Disheng Liu and Jeirui Peng and Jing Ma and Yu Yin},
journal= {arXiv preprint arXiv:2503.23137},
year = {2026}
}