中文

超越发散创意:基于人类的大型语言模型创意评估

计算与语言 2026-01-29 v1

摘要

大型语言模型(LLM)日益用于语言创意任务。然而,先前对 LLM 创意能力的评估仍严重依赖于人类创意理论,难以解读。广泛使用的发散关联任务(DAT)仅关注新颖性,忽略了创意的核心要素——恰当性。我们对一系列最先进的 LLM 在 DAT 上的表现进行评估,发现其得分低于两个不具备任何创意能力的基线,动摇了该任务用于模型评估的有效性。基于人类创意理论,我们引入条件发散关联任务(CDAT)。CDAT 在情境恰当性条件下评估新颖性,能够更好地区分噪声与创意,同时保持简单和客观。在 CDAT 下,较小的模型家族往往表现出最高的创意,而高级模型家族则在新颖性较低时更偏向恰当性。我们假设训练和对齐可能在这条前沿线上产生偏移,使模型输出更恰当但更不够创意。我们发布了数据集和代码。

关键词

引用

@article{arxiv.2601.20546,
  title  = {Beyond Divergent Creativity: A Human-Based Evaluation of Creativity in Large Language Models},
  author = {Kumiko Nakajima and Jan Zuiderveld and Sandro Pezzelle},
  journal= {arXiv preprint arXiv:2601.20546},
  year   = {2026}
}

备注

Accepted to Findings of EACL 2026