中文

使用非负矩阵分解探索 COVID-19 研究文献中的主题趋势

计算与语言 2025-03-25 v1

摘要

本 work 应用非负矩阵分解(NMF)对新冠肺炎开放研究数据集(CORD-19)进行主题建模,以揭示其在广泛的新冠肺炎研究文献中所蕴含的主题结构及其演变。NMF 将文档-词矩阵分解为两个非负矩阵,有效地表示主题及其在文档中的分布。这有助于我们了解文档与主题之间的关联强度以及主题与词之间的关联。我们描述了完整的 methodology,其中包括一系列严格的预处理步骤,以标准化可用文本数据同时保持短语语境,随后采用术语频率-逆文档频率(tf-idf)进行特征提取,该方法根据词在数据集中的频率和稀有性对词进行加权。为确保主题模型的稳健性,我们进行了稳定性分析。该过程评估了不同主题数量下 NMF 主题模型的稳定性得分,从而选择我们分析的最佳主题数量。通过我们的分析,我们在 CORD-19 数据集中跟踪了主题随时间的演变。我们的发现促进了对新冠肺炎研究领域知识结构的理解,为该领域的未来研究提供了宝贵资源。

关键词

引用

@article{arxiv.2503.18182,
  title  = {Exploring Topic Trends in COVID-19 Research Literature using Non-Negative Matrix Factorization},
  author = {Divya Patel and Vansh Parikh and Om Patel and Agam Shah and Bhaskar Chaudhury},
  journal= {arXiv preprint arXiv:2503.18182},
  year   = {2025}
}