中文

评估与理解大型语言模型的创造力

计算与语言 2025-02-21 v1 人工智能

摘要

在自然语言处理领域,大型语言模型(LLM)的快速发展引起了越来越多的关注。LLM在各种任务中展现出高水平的创造力,但评估这种创造力的方法尚不充分。LLM创造力的评估需要考虑与人类的差异,需要在平衡准确性和效率的同时进行多维度测量。本文旨在建立一个评估LLM创造力水平的有效框架。通过改编托兰斯创造性思维测验,该研究评估了各种LLM在7个任务上的创造性表现,强调了流畅性、灵活性、原创性和精致性四个标准。在此背景下,我们开发了一个包含700个问题的综合测试数据集和一种基于LLM的评估方法。此外,本研究还对LLM对不同提示和角色扮演情境的响应进行了新颖的分析。我们发现LLM的创造力主要在原创性方面不足,而在精致性方面表现出色。此外,提示的使用和模型的角色扮演设置显著影响创造力。实验结果表明,多个LLM之间的协作可以增强原创性。值得注意的是,我们的研究结果揭示了人类评估与LLM在影响创造力的人格特质方面的一致性。这些发现强调了LLM设计对创造力的显著影响,并架起了人工智能与人类创造力之间的桥梁,为LLM的创造力和潜在应用提供了见解。

关键词

引用

@article{arxiv.2401.12491,
  title  = {Assessing and Understanding Creativity in Large Language Models},
  author = {Yunpu Zhao and Rui Zhang and Wenyi Li and Di Huang and Jiaming Guo and Shaohui Peng and Yifan Hao and Yuanbo Wen and Xing Hu and Zidong Du and Qi Guo and Ling Li and Yunji Chen},
  journal= {arXiv preprint arXiv:2401.12491},
  year   = {2025}
}