经验文本语料库的主题建模:相较于语义图的有效性、可靠性与可重复性
计算与语言
2018-06-05 v1
摘要
利用为研究卓越框架(REF 2014)评估所提交的6,638份社会影响案例描述,我们复现了在此背景下所做的主题模型(潜在狄利克雷分配或LDA),并将结果与使用传统词-文档矩阵(主成分分析或PCA)的因子分析结果进行比较。例如,从样本中移除一小部分文档对LDA的平均影响远大于对基于PCA模型的影响,以至于PCA情形下的最大畸变所起的作用小于LDA模型最小畸变的作用。然而在语义连贯性方面,LDA模型优于基于PCA的模型。主题模型告知我们所研究文档集的统计特性,但这些结果是统计性的,不应在未使用领域特定语义图进行后续跟进的情况下用于语义解释——例如在资助遴选与微观决策或学术工作中。
引用
@article{arxiv.1806.01045,
title = {Topic Modelling of Empirical Text Corpora: Validity, Reliability, and Reproducibility in Comparison to Semantic Maps},
author = {Tobias Hecking and Loet Leydesdorff},
journal= {arXiv preprint arXiv:1806.01045},
year = {2018}
}