中文

人类与大型语言模型在创意短篇小说生成方面的评估

计算与语言 2025-05-13 v5 人工智能

摘要

故事写作是人类想象力的基本方面,高度依赖创造力来产生新颖、有效且令人惊讶的叙事。虽然大型语言模型(LLMs)已展现出生成高质量故事的能力,但其创意故事写作能力仍未被充分探索。在本研究中,我们使用基于五个句子提示词创意的故事写作任务,对60个LLM和60个人在创意故事生成中的创造力进行了系统分析。我们使用自动评估方法,从新颖性、惊喜性、多样性和语言复杂性等多个创造力维度对模型生成和人类生成的故事进行评估。我们还从非专家和专家人类评分者以及LLMs处收集创造力评分和图灵测试分类。自动指标显示,LLMs生成风格上复杂的故事,但在新颖性、惊喜性和多样性方面与普通人类作者相比仍有差距。专家评分通常与自动指标一致。然而,LLMs和非专家评分者认为LLM生成的故事比人类生成的故事更具创造力。我们讨论了这些评分差异产生的原因及其对人类创造力和人工智能创造力的启示。

关键词

引用

@article{arxiv.2411.02316,
  title  = {Evaluating Creative Short Story Generation in Humans and Large Language Models},
  author = {Mete Ismayilzada and Claire Stevenson and Lonneke van der Plas},
  journal= {arXiv preprint arXiv:2411.02316},
  year   = {2025}
}

备注

Accepted to ICCC 2025