中文

80000本书中的语义新颖性轨迹:基于跨语料库嵌入的分析

计算与语言 2026-03-03 v1 信息检索

摘要

我采用Schmidhuber的压缩进步理论,对80000多本跨越两百年的英语出版物进行语义新颖性轨迹分析。使用句子转换器段落嵌入和运行中心新颖性度量,我将28730本1920年前的Project Gutenberg书籍(PG19)与52796本现代英语书籍(Books3,约1990-2010年)进行比较。主要发现可概括为四点:第一,现代书籍的平均段落级新颖性约高出10%(0.503 vs. 0.459)。第二,轨迹曲折性——即嵌入空间中累积路径长度与净位移之比——在现代语料库中几乎翻倍(增加67%)。第三,趋向收敛的叙事曲线,即新颖性随着趋于固定的语义寄存器而下降,在1920年前文学作品中出现频率是现代语料库的2.3倍。第四,新颖性与读者质量评级正交(r = -0.002),表明Schmidhuber意义上的有趣程度在结构上独立于感知的文学价值。通过PAA-16表示对段落级轨迹进行聚类,揭示了8种叙事形状原型,其在两个时代之间的分布发生了实质性变化。所有分析代码和交互式探索工具均公开于https://bigfivekiller.online/novelty_hub。

关键词

引用

@article{arxiv.2603.01791,
  title  = {Semantic Novelty Trajectories in 80,000 Books: A Cross-Corpus Embedding Analysis},
  author = {Fred Zimmerman},
  journal= {arXiv preprint arXiv:2603.01791},
  year   = {2026}
}

备注

12 pages, 4 figures, 5 tables