HumorRank:基于锦标赛的大语言模型幽默生成评测排行榜
计算与语言
2026-04-23 v1
摘要
评估大语言模型(LLM)的幽默感是一个开放性挑战,因为现有方法产生的是孤立且不可比的指标,而非统一的模型排名,这使得难以跨系统追踪进展。我们引入了 HumorRank,一个用于文本幽默生成的基于锦标赛的评估框架和排行榜。使用 SemEval-2026 MWAHAHA 测试数据集,我们在涵盖专有、开放权重和专用系统的九个模型中进行了广泛的自动成对评估。基于言语幽默一般理论(GTVH)的成对判断通过自适应瑞士轮锦标赛进行聚合,并使用 Bradley-Terry 最大似然估计(MLE)生成全局一致的幽默生成能力排名。我们的结果表明,HumorRank 产生了具有统计学依据的模型分层,显示幽默质量取决于对喜剧机制的掌握,而不仅仅取决于模型规模。因此,HumorRank 为基准测试和理解 LLM 生成的幽默提供了一种可扩展、可解释的方法论。
引用
@article{arxiv.2604.19786,
title = {HumorRank: A Tournament-Based Leaderboard for Evaluating Humor Generation in Large Language Models},
author = {Edward Ajayi and Prasenjit Mitra},
journal= {arXiv preprint arXiv:2604.19786},
year = {2026}
}