中文

大型语言模型的创造力已达顶峰?LLM 间与 LLM 内部变异性的分析

计算与语言 2025-04-18 v1 人工智能 人机交互

摘要

继 2023 年初 ChatGPT 被广泛采用之后,许多研究报告称大型语言模型 (LLM) 在创造性任务中可以匹配甚至超越人类表现。然而,目前尚不清楚 LLM 是否随着时间的推移变得更具创造力,以及其创造性输出的一致性如何。在本研究中,我们评估了 14 个广泛使用的 LLM——包括 GPT-4、Claude、Llama、Grok、Mistral 和 DeepSeek——使用了两种经过验证的创造力评估方法:发散联想任务 (DAT) 和替代用途任务 (AUT)。与预期相反,我们没有发现过去 18-24 个月内创造力表现提升的证据,其中 GPT-4 的表现甚至不如以前的研究。对于更广泛使用的 AUT,所有模型的平均表现均优于普通人类,其中 GPT-4o 和 o3-mini 表现最佳。然而,仅有 0.28% 的 LLM 生成响应达到了人类创造力基准的前 10%。除了模型间差异外,我们还记录了显著的模型内部变异性:同一个 LLM 在给定相同提示时,可以产生从低于平均水平到具有独创性的输出。这种变异性对创造力研究和实际应用都有重要影响。忽视这种变异性可能会导致对 LLM 创造力潜力的误判,从而高估或低估其能力。提示的选择对 LLM 的影响各不相同。我们的研究结果强调需要更细致的评估框架,并突出了在创造性环境中使用生成式人工智能 (GenAI) 工具时模型选择、提示设计和重复评估的重要性。

关键词

引用

@article{arxiv.2504.12320,
  title  = {Has the Creativity of Large-Language Models peaked? An analysis of inter- and intra-LLM variability},
  author = {Jennifer Haase and Paul H. P. Hanel and Sebastian Pokutta},
  journal= {arXiv preprint arXiv:2504.12320},
  year   = {2025}
}

备注

19 pages + Appendix, 13 figure