哪些大语言模型能听懂笑话?用HumorBench探测非STEM推理能力
计算与语言
2025-07-30 v1 人工智能
摘要
我们提出了HumorBench,一个旨在评估大语言模型(LLM)推理和解释卡通字幕中复杂幽默能力的基准。随着推理模型在数学和科学领域的现有基准上日益饱和,对模型智能在STEM领域之外进行新颖且具有挑战性的评估至关重要。推理从根本上参与了基于文本的幽默理解,需要识别卡通/字幕中概念与外部文化参考、双关语及其他机制之间的联系。HumorBench包含约300对来自《纽约客》字幕大赛和Cartoonstock.com的独特卡通-字幕对,并配有专家标注的评估准则,用于识别关键的笑点元素。LLM根据其对幽默的解释以及识别笑点元素的能力进行评估。为了在此任务上表现良好,模型必须形成并测试关于概念之间关联的假设,可能从最初的解释回溯,以得出最合理的解释。我们对当前SOTA模型进行的广泛基准测试揭示了三个关键见解:(1) LLM在STEM推理上的进展有效迁移到了幽默理解上;(2) 仅在STEM推理数据上训练的模型在HumorBench上仍表现良好,展示了推理能力的强迁移性;(3) 通过增加思考令牌预算来扩展测试时计算,在不同模型的幽默推理中产生了混合结果。
引用
@article{arxiv.2507.21476,
title = {Which LLMs Get the Joke? Probing Non-STEM Reasoning Abilities with HumorBench},
author = {Reuben Narad and Siddharth Suresh and Jiayi Chen and Pine S. L. Dysart-Bricken and Bob Mankoff and Robert Nowak and Jifan Zhang and Lalit Jain},
journal= {arXiv preprint arXiv:2507.21476},
year = {2025}
}