通过神经主题建模从大规模历史报纸档案中自动提取历史洞察
计算与语言
2025-12-15 v1 人工智能
信息检索
摘要
从大型非结构化历史报纸档案集合中提取连贯且可被人理解的主题,由于主题演化、光学字符识别(OCR)噪声以及文本体量巨大而面临重大挑战。传统主题建模方法,如潜在狄利克雷分配(LDA),往往难以捕捉历史文本中话语的复杂性和动态性。为解决这些局限性,我们采用BERTopic。这种神经主题建模方法利用基于Transformer的嵌入来提取和分类主题,尽管其日益流行,但在历史研究中仍未得到充分利用。我们的研究聚焦于1955年至2018年间发表的文章,专门审视关于核能和核安全的话语。我们分析了语料库中各种主题分布随时间的演化,以揭示长期趋势和公众话语的转变。这使我们能够更准确地探索公众话语中的模式,包括与核能和核武器相关主题的共现及其随时间的主题重要性变化。我们的研究展示了BERTopic作为传统方法替代方案的可扩展性和语境敏感性,为从报纸档案中提取的历史话语提供了更丰富的洞察。这些发现为历史、核能和社会科学研究做出贡献,同时反思当前局限性并提出未来工作的潜在方向。
引用
@article{arxiv.2512.11635,
title = {Automating Historical Insight Extraction from Large-Scale Newspaper Archives via Neural Topic Modeling},
author = {Keerthana Murugaraj and Salima Lamsiyah and Marten During and Martin Theobald},
journal= {arXiv preprint arXiv:2512.11635},
year = {2025}
}
备注
This is a preprint of a manuscript submitted to Digital Scholarship in the Humanities (Oxford University Press). The paper is currently under peer review