中文

评估大型语言模型与人类语言创造力的比较方法

计算与语言 2025-11-11 v2

摘要

本文介绍了一种针对人类和大型语言模型(LLM)的通用语言创造力测试。该测试包含各种任务,旨在评估它们基于构词过程(派生与复合)和隐喻语言使用来生成新原创词汇和短语的能力。我们对该测试进行了管理,测试对象为24名人类和同等数量的 LLM,并使用 OCSAI 工具从三个标准自动评估了它们的答案:原创性、详尽性和灵活性。结果表明,LLM 不仅在所有评估标准中优于人类,而且在八项测试任务中有六项表现更好。随后我们计算了各个答案的唯一性,结果显示人类与 LLM 之间存在一些微小差异。最后,我们对数据集进行了简短的人工分析,揭示了人类更倾向于 E(扩展型)创造力,而 LLM 更青睐 F(固定型)创造力。

关键词

引用

@article{arxiv.2507.12039,
  title  = {A Comparative Approach to Assessing Linguistic Creativity of Large Language Models and Humans},
  author = {Anca Dinu and Andra-Maria Florescu and Alina Resceanu},
  journal= {arXiv preprint arXiv:2507.12039},
  year   = {2025}
}

备注

Accepted for presentation at KES 2025. To appear in Procedia Computer Science (Elsevier)