中文

AI中的回声:量化LLM输出中情节多样性的缺乏

计算与语言 2025-09-03 v2

摘要

随着大型语言模型(LLM)的快速发展,LLM在创意内容构思和生成中的应用日益增多。一个关键问题浮现:当前的LLM能否提供足够多样化的想法以真正增强集体创造力?我们考察了两种最先进的LLM——GPT-4和LLaMA-3——在故事生成中的表现,发现LLM生成的故事通常包含在多次生成中重复出现的情节元素。为了量化这一现象,我们引入了Sui Generis分数,这是一种自动度量,用于衡量在相同提示下LLM生成的替代故事情节中某个情节元素的独特性。通过对100篇短篇故事的评估,我们发现LLM生成的故事通常包含在不同生成和不同LLM之间频繁重复出现的独特情节元素组合,而原始人类编写的情节很少被完全重现甚至部分重复。此外,我们的人工评估表明,故事片段中Sui Generis分数的排名与人类对惊喜程度的判断呈中等程度的相关性,尽管分数计算完全自动,不依赖人类判断。

关键词

引用

@article{arxiv.2501.00273,
  title  = {Echoes in AI: Quantifying lack of plot diversity in LLM outputs},
  author = {Weijia Xu and Nebojsa Jojic and Sudha Rao and Chris Brockett and Bill Dolan},
  journal= {arXiv preprint arXiv:2501.00273},
  year   = {2025}
}

备注

PNAS Vol. 122 No. 35. Copyright \c{opyright} 2025 the Author(s). Published by PNAS. This open access article is distributed under Creative Commons Attribution-NonCommercial-NoDerivatives License 4.0 (CC BY-NC-ND)