通过对叙事社会结构的大规模网络分析评估 LLM 故事生成
计算与语言
2025-10-23 v1 机器学习
摘要
评估大型语言模型(LLM)在复杂任务中的创造力通常需要难以规模化的人工评估。我们引入了一种新颖的、可规模化的方法,通过将叙事中的底层社会结构分析为带符号的角色网络来评估 LLM 故事生成。为了证明其有效性,我们使用来自四个领先 LLM(GPT-4o、GPT-4o mini、Gemini 1.5 Pro 和 Gemini 1.5 Flash)和一个人工撰写语料库生成的 1,200 多个故事的网络,进行了大规模比较分析。基于密度、聚类和带符号边权重等网络属性,我们的发现表明,LLM 生成的故事始终表现出对紧密团结的积极关系的强烈偏好,这与先前使用人工评估的研究发现相一致。我们提出的方法为评估当前和未来 LLM 创意故事生成中的局限性和倾向提供了一个有价值的工具。
引用
@article{arxiv.2510.18932,
title = {Evaluating LLM Story Generation through Large-scale Network Analysis of Social Structures},
author = {Hiroshi Nonaka and K. E. Perry},
journal= {arXiv preprint arXiv:2510.18932},
year = {2025}
}
备注
This paper has 14 pages and 8 figures. To be presented at the NeurIPS 2025 Workshop on Evaluating the Evolving LLM Lifecycle: Benchmarks, Emergent Abilities, and Scaling