利用自然语言处理挖掘 COVID-19 大流行期间 Twitter 上的议题
信息检索
2022-12-20 v2 机器学习
社会与信息网络
摘要
近期全球爆发的冠状病毒病(COVID-19)已蔓延至全球各个角落。国际旅行禁令、恐慌性购买以及自我隔离的需求是这一新时代带来的诸多社会挑战中的一部分。Twitter 平台已在多项公共卫生研究中用于识别地方和全球尺度上公众对某一事件的看法。为理解公众对该大流行的担忧和回应,需要一个能利用机器学习技术过滤无关推文并识别如 Twitter 等社交媒体上重要讨论主题的系统。在本研究中,我们构建了一个系统来识别 2020 年 1 月 1 日至 2020 年 4 月 30 日期间与 COVID-19 大流行相关的推文,并探索主题建模以识别我们数据集中该时期讨论最多的话题和主题。此外,我们分析了话题相对于该大流行期间所发生的事件的时间变化。我们发现八个主题足以识别语料库中的主题。这些主题呈现出时间趋势。主导主题随时间变化并与 COVID-19 大流行相关事件一致。
引用
@article{arxiv.2011.00377,
title = {Leveraging Natural Language Processing to Mine Issues on Twitter During the COVID-19 Pandemic},
author = {Ankita Agarwal and Preetham Salehundam and Swati Padhee and William L. Romine and Tanvi Banerjee},
journal= {arXiv preprint arXiv:2011.00377},
year = {2022}
}
备注
11 pages, 5 figures, 5 tables. Long version of accepted Paper at IEEE Big Data 2020 (https://bigdataieee.org/BigData2020/AcceptedPapers.html)