中文

瑞典语冠状病毒新闻报道的主题建模:基于潜在狄利克雷分配方法的案例研究

计算与语言 2023-04-19 v6 社会与信息网络

摘要

主题建模(TM)属于自然语言理解(NLU)与自然语言处理(NLP)的研究分支,旨在从大型文档与数据集中辅助进行洞察性分析,例如主要主题的摘要与主题变迁。由于其对大数据分析的影响,此类发现在实际应用中的受欢迎程度与日俱增。在本研究中,我们从社交媒体与医疗健康领域出发,应用流行的潜在狄利克雷分配(LDA)方法对瑞典语冠状病毒新闻报道中的主题变迁进行建模。我们描述了所构建的语料库(包含 6515 篇文章)、所应用的方法,以及从 2020 年 1 月 17 日至 2021 年 3 月 13 日约 1 年零两个月的时段内主题变迁的统计。我们希望本工作能成为主题建模落地应用的宝贵资源,并在大流行时代为类似案例研究提供启发,以支持社会经济影响研究以及临床与医疗健康分析。我们的数据与源代码公开于 https://github.com/poethan/Swed_Covid_TM 关键词:潜在狄利克雷分配(LDA);主题建模;冠状病毒;大流行;自然语言理解;BERT-topic

关键词

引用

@article{arxiv.2301.03029,
  title  = {Topic Modelling of Swedish Newspaper Articles about Coronavirus: a Case Study using Latent Dirichlet Allocation Method},
  author = {Bernadeta Griciūtė and Lifeng Han and Goran Nenadic},
  journal= {arXiv preprint arXiv:2301.03029},
  year   = {2023}
}

备注

Accepted to International HealthNLP WS @ IEEE-ICHI2023 https://ieeeichi.github.io/ICHI2023/