中文

评估大型语言模型的创造力:测试、局限与新前沿

人工智能 2026-05-14 v1 计算与语言 人机交互

摘要

衡量大型语言模型(LLM)的创造力对于设计能够提升创造力的方法以及增进我们对这种能力的科学理解至关重要。为此,近年来变得常见的是对 LLM 进行人类创造力测试。尽管这些测试提供了便利且完全自动化的评分方式,但它们作为机器创造力衡量标准的有效性尚未得到确立,这些测试在预测人类创造力方面的有效性也有限。为此,我们进行了首次大规模、系统性的研究,评估人类创造力测试在预测 LLM 创造成就方面的效果,针对三个目标构造:创意写作、发散思维和科学构想。我们发现,发散关联任务(DAT)和条件 DAT 是分别预测创意写作和发散思维的最佳预测器,但测试效果在不同构造之间存在显著差异,没有单一测试能很好地预测所有构造。此外,与流行观念相反,现存没有测试能可靠地预测科学构想能力。为此,我们引入了发散远程关联测试(DRAT),这是一种词汇-空间测试,旨在评估单一仪器中的收敛性和发散性思维。DRAT 是唯一一个显著预测科学构想能力的创造力测试,表现出对主要设计选择的鲁棒性。进一步地,DRAT 的性能提升无法从 DAT 和远程关联测试的任意线性组合中恢复,这表明在单一测试中评估发散性和收敛性思维是可靠预测科学构想能力的关键。

关键词

引用

@article{arxiv.2605.13450,
  title  = {Assessing the Creativity of Large Language Models: Testing, Limits, and New Frontiers},
  author = {Samuel Schapiro and Alexi Gladstone and Jonah Black and Heng Ji},
  journal= {arXiv preprint arXiv:2605.13450},
  year   = {2026}
}

备注

36 pages. Extended version of work under review