预告片警告:以叙事预测为指标衡量 LLM 叙事故事中的张力
计算与语言
2026-04-14 v1
摘要
目前的 LLM 仍未能持续生成引人入胜的故事,也未能识别到这一失败——在领先的创意写作基准(EQ-Bench)上,LLM评委会将零样本AI故事排在纽约客短篇小说之上,而后者是文学小说的金标准。我们认为现有评估标准忽略了引人入胜的人类故事的一个关键维度:叙事张力。我们引入100-Endings指标:逐句分析故事,在每个位置,模型仅凭截至目前的文本预测故事如何结束100次,我们将张力衡量为预测结果与真实结局不匹配的频率。除不匹配率外,句子级别的曲线还产生补充统计数据,如拐点率,这一几何度量衡量曲线反转次数的频率,追踪情节转折与揭秘。不同于基于评估标准的评委会,100-Endings正确地将纽约客故事排在 LLM 输出之上。基于叙事学原理,我们设计了一个故事生成管道,包含情节模板分析、构想构思和叙事脚手架等结构性约束。我们的管道显著提升了叙事张力(以100-Endings指标衡量),同时保持了在EQ-Bench排行榜上的表现。
关键词
引用
@article{arxiv.2604.09854,
title = {Spoiler Alert: Narrative Forecasting as a Metric for Tension in LLM Storytelling},
author = {Peiqi Sui and Yutong Zhu and Tianyi Cheng and Peter West and Richard Jean So and Hoyt Long and Ari Holtzman},
journal= {arXiv preprint arXiv:2604.09854},
year = {2026}
}
备注
29 pages, 10 figures, 9 tables