SarcasmBench:面向大语言模型的讽刺理解评估
计算与语言
2024-08-27 v2 人工智能
摘要
在大语言模型(LLM)时代,「系统 I」——即快速、无意识和直觉性的任务,例如情感分析、文本分类等——被认为已经成功解决。然而,讽刺作为一种微妙的语言现象,常运用夸张和比喻等修辞手法来传达真实的情感和意图,涉及比情感分析更高层次的抽象层次。当考虑讽刺理解时,关于 LLM 成功的说法可能并不完全成立,这一问题日益受到关注。为了回答这一问题,我们选取了十一个 SOTA 大语言模型和八个 SOTA 预训练语言模型(PLMs),并通过不同的提示方法——即零样本输入/输出(IO)提示、少样本 IO 提示和思维链(CoT)提示——在六个广泛使用的基准数据集上进行了全面评估。我们的结果揭示了三个关键发现:(1)当前 LLMs 在六个讽刺基准数据集上的表现均不如基于监督 PLMs 的讽刺检测基线。这表明仍需付出大量努力来提升 LLMs 对人类讽刺的理解。(2)GPT-4 在各种提示方法下始终且显著优于其他 LLMs,平均提升 14.0%。Claude 3 和 ChatGPT 在 GPT-4 之后展现出次优性能。(3)少样本 IO 提示方法优于另外两种方法:零样本 IO 和少样本 CoT。其原因在于,讽刺检测是一种整体的、直觉性的和非理性的认知过程,被认为不遵循逐步的逻辑推理,因此 CoT 在理解讽刺方面不如其在数学推理任务中有效。
引用
@article{arxiv.2408.11319,
title = {SarcasmBench: Towards Evaluating Large Language Models on Sarcasm Understanding},
author = {Yazhou Zhang and Chunwang Zou and Zheng Lian and Prayag Tiwari and Jing Qin},
journal= {arXiv preprint arXiv:2408.11319},
year = {2024}
}