规模化语义新颖性:叙事形态分类学与28,606本书的读者预测
计算与语言
2026-02-25 v1
摘要
我提出了语义新颖性——计算每个段落句子嵌入与所有前序段落运行质心之间的余弦距离——作为语料库规模下叙事结构的信息论度量。将其应用于 PG19(1920 年以前的英语文学)中的28,606本书,我使用768维的 SBERT 嵌入计算段落级新颖性曲线,然后将其降维为16段的分段聚合近似 (PAA)。基于 PAA 向量的 Ward 链接聚类揭示了八种典型叙事形态原型,从快速收敛的“陡峭下降”到不断升级的不可预测性的“陡峭上升”。新颖性轨迹的体积-方差是最强的、长度无关的读者预测指标(部分 rho = 0.32),其后为速度 (rho = 0.19) 和终点/起点比值 (rho = 0.19)。绕度性显示出强烈的原始相关性 (rho = 0.41),但与长度相关性高达93%;在控制后,部分 rho 下降至 0.11——这表明语料库研究中的粗糙相关性可能被长度混淆所主导。体裁对叙事形态具有强大的约束作用 (卡方检验 = 2121.6, p < 10 的负 242 次方),小说保持平缓轮廓,而非小说则提前加载信息。历史分析显示,1840 年至 1910 年间的书籍逐渐变得更加可预测 (T/I 比值趋势 r = -0.74, p = 0.037)。SAX 分析显示85%的签名唯一性,表明每本书在语义空间中几乎独特地追踪一条路径。这些发现表明,信息密度动力学——与情感或主题不同——是叙事结构的基本维度,并对读者参与度产生可衡量的影响。数据集:https://huggingface.co/datasets/wfzimmerman/pg19-semantic-novelty
引用
@article{arxiv.2602.20647,
title = {Semantic Novelty at Scale: Narrative Shape Taxonomy and Readership Prediction in 28,606 Books},
author = {W. Frederick Zimmerman},
journal= {arXiv preprint arXiv:2602.20647},
year = {2026}
}
备注
six figures. dataset available at Hugging Face