CreativityPrism:大型语言模型创意的全面评估框架
计算与语言
2026-02-19 v2 人工智能
摘要
创意常被视为人类智慧的标志。尽管大型语言模型(LLM)日益被认为能够生成富有创意的文本,但目前尚无全面且可扩展的框架来评估其在多样化情景下的创意能力。现有方法要么严重依赖人类评估,限制速度和可扩展性,要么在不同领域和不同创意定义之间呈碎片化。为此,我们提出CREATIVITYPRISM,一个整合三个领域八项任务(发散思维、创意写作和逻辑推理)的评估分析框架,形成一种强调三个维度(质量、新颖性和多样性)的创意分类法。该框架设计为可扩展,采用经过验证的自动评估评判官,可与人类注释相匹配。我们在CREATIVITYPRISM上评估了17个最先进(SoTA)专有和开源LLM,发现虽然专有LLM在创意写作和逻辑推理任务中显著领先开源LLM约15%,但在发散思维领域没有显著优势,该领域在现有后训练方案中受到较少探索。我们的分析还显示,单一创意维度或领域的高性能几乎不会推广到其他领域;具体而言,新颖性指标常显示弱或负相关。这一碎片化现象确认了CREATIVITYPRISM这一类全面、多维度框架对于有意义的LLM创意评估至关重要。
引用
@article{arxiv.2510.20091,
title = {CreativityPrism: A Holistic Evaluation Framework for Large Language Model Creativity},
author = {Zhaoyi Joey Hou and Bowei Alvin Zhang and Yining Lu and Bhiman Kumar Baghel and Anneliese Brei and Ximing Lu and Meng Jiang and Faeze Brahman and Snigdha Chaturvedi and Haw-Shiuan Chang and Daniel Khashabi and Xiang Lorraine Li},
journal= {arXiv preprint arXiv:2510.20091},
year = {2026}
}