中文

面向计算近读:用于映射普鲁斯克《埃尔根尼》叙事主题的混合主题模型

计算与语言 2026-03-23 v1

摘要

本文提出一种混合主题模型框架,用于计算文学分析,将潜在 Dirichlet 分配(LDA)与稀疏偏最小二乘判别分析(sPLS-DA)相结合,以建模叙事诗歌的主题结构和纵向动态。作为案例研究,我们分析阿历克小提尔·普鲁斯克的《埃尔根尼》——一部用意大利译本进行的分诗小说。我们测试无监督与监督词汇结构在小语料库中的收敛性。将诗歌文本分割为35个 lemmas 内容词文档,提取出5个稳定且可解释的主题。为解决小语料库的不稳定性,采用多种子共识协议。使用sPLS-DA作为监督探针可增强可解释性,通过识别细化每个主题的词汇标记。叙事中心——一组连续的节段标记关键情节——将包袱字方法扩展到叙事层面,揭示主题混合如何与诗歌的情感与结构弧线相吻合。本框架不取代传统文学阐释,而是提供一种计算形式的近读,说明即使在抽象掉格律、音韵或本土形态学等风格特征后,轻量概率模型也能为复杂叙事诗歌生成可重复的主题图。尽管仅依赖单一lemmatized译本,本方法仍提供一种透明的方法ological模板,可适用于比较研究中的其他高密度文学文本。

关键词

引用

@article{arxiv.2603.19940,
  title  = {Hybrid topic modelling for computational close reading: Mapping narrative themes in Pushkin's Evgenij Onegin},
  author = {Angelo Maria Sabatini},
  journal= {arXiv preprint arXiv:2603.19940},
  year   = {2026}
}

备注

25 pages, 4 figures, 2 supplementary materials; submitted to Digital Scholarship in the Humanities (under review)