中文

使用大语言模型分析历史报纸的若干方法

计算与语言 2026-03-30 v2

摘要

本研究对斯洛文尼亚历史报纸《Slovenec》和《Slovenski narod》(来自 sPeriodika 语料库)进行计算分析,结合主题建模、基于大语言模型 (LLM) 的方面级情感分析、实体图可视化和定性话语分析,考察在十二世纪之交公共话语中集体身份、政治取向和民族归属感的表现方式。使用 BERTopic,我们识别出主要的主题模式,显示两份报纸在共同关切方面存在相似之处,但在意识形态差异方面存在明显区别,分别反映其保守-天主教和自由-进步主义取向。我们进一步评估了四种遵循指令的大语言模型在 OCR 降级的历史斯洛文尼亚语情感分类中的表现,并选出斯洛文尼亚语适配的 GaMS3-12B-Instruct 模型作为大规模应用的最佳模型,同时也记录了其在中性情感上性能优于积极或消极情感的重要局限。应用于数据集规模,该模型揭示了集体身份呈现方式的有意义变异,其中一些群体主要出现在中性描述性语境中,而另一些群体则更常出现在评估性或冲突性话语中。我们随后创建命名实体图,以探讨集体身份与地点的关系。我们采用混合方法分析命名实体图,将定量网络分析与批判性话语分析相结合。该研究聚焦于交织的历史政治和社会经济身份的萌发与发展。总体而言,本研究证明了将可扩展的计算方法与批判性解释相结合,对于支持处理噪声较大的历史报纸数据的数字人文研究具有重要价值。

关键词

引用

@article{arxiv.2603.25051,
  title  = {Approaches to Analysing Historical Newspapers Using LLMs},
  author = {Filip Dobranić and Tina Munda and Oliver Pejić and Vojko Gorjanc and Uroš Šmajdek and David Bordon and Jakob Lenardič and Tjaša Konovšek and Kristina Pahor de Maiti Tekavčič and Ciril Bohak and Darja Fišer},
  journal= {arXiv preprint arXiv:2603.25051},
  year   = {2026}
}