中文

WebNovelBench:将 LLM 小说家置于网文分布中

计算与语言 2025-05-22 v1 人工智能

摘要

对大型语言模型(LLM)长篇叙事能力的稳健评估仍是一个重大挑战,因为现有基准往往缺乏必要的规模、多样性或客观衡量标准。为此,我们引入 WebNovelBench,一个专为评估长篇小说生成而设计的新型基准。WebNovelBench 利用超过 4000 部中文网络小说的大规模数据集,将评估框架设计为从概要到故事的生成任务。我们提出了一个多层次框架,包含八个叙事质量维度,通过 LLM-as-Judge 方法进行自动评估。得分采用主成分分析(PCA)聚合,并映射到对人类创作作品的百分位排名。我们的实验表明,WebNovelBench 能够有效区分人类所著名的杰作、流行网络小说和 LLM 生成的内容。我们对 24 种最先进的 LLM 进行了全面分析,对其叙事能力进行了排序,并为未来发展提供了洞见。这一基准提供了一种可扩展、可复制且数据驱动的方法,用于评估和推动 LLM 驱动的叙事生成。

关键词

引用

@article{arxiv.2505.14818,
  title  = {WebNovelBench: Placing LLM Novelists on the Web Novel Distribution},
  author = {Leon Lin and Jun Zheng and Haidong Wang},
  journal= {arXiv preprint arXiv:2505.14818},
  year   = {2025}
}