中文

并非所有笑话都能奏效:评估大型语言模型对职场幽默的理解

计算与语言 2025-06-09 v2 计算机与社会

摘要

随着人工智能(AI)和大型语言模型(LLM)的最新进展,日常任务的自动化(如自动写作)正受到越来越多的关注。因此,研究重点集中在将 LLM 与人类价值观对齐,然而幽默,尤其是职场中使用的专业行业幽默,却在很大程度上被忽视了。为解决这一问题,我们开发了一个专业幽默语句数据集,并附带了决定每条语句适宜性的特征。我们对五个 LLM 的评估表明,LLM 通常难以准确判断幽默的适宜性。

关键词

引用

@article{arxiv.2506.01819,
  title  = {Not All Jokes Land: Evaluating Large Language Models Understanding of Workplace Humor},
  author = {Mohammadamin Shafiei and Hamidreza Saffari},
  journal= {arXiv preprint arXiv:2506.01819},
  year   = {2025}
}