中文

TBCOV:带情感、实体、地理与性别标签的二十亿条多语言COVID-19推文

社会与信息网络 2023-06-05 v1 计算与语言

摘要

在大规模聚集事件(如卫生紧急事件与疾病暴发)期间,社交网络的广泛使用提供了对公民生成数据的即时访问,这些数据承载关于公众意见、情绪、紧迫需求与态势报告的丰富信息。此类信息可帮助当局理解突发情况并作出相应反应。此外,社交媒体在应对错误信息与虚假信息方面发挥着至关重要的作用。本工作提出TBCOV,一个大规模Twitter数据集,包含在全球范围内连续一年多收集的超二十亿条与COVID-19大流行相关的多语言推文。更重要的是,我们使用多个最先进的深度学习模型为数据增添重要属性,包括情感标签、命名实体(如人物、组织、地点提及)、用户类型与性别信息。最后但同样重要的是,提出了一种地理标记方法,将国家、州、县与城市信息分配给推文,从而支持大量数据分析任务以理解现实世界问题。我们的情感与趋势分析揭示了有趣的见解,并证实了TBCOV对重要主题的广泛覆盖。

关键词

引用

@article{arxiv.2110.03664,
  title  = {TBCOV: Two Billion Multilingual COVID-19 Tweets with Sentiment, Entity, Geo, and Gender Labels},
  author = {Muhammad Imran and Umair Qazi and Ferda Ofli},
  journal= {arXiv preprint arXiv:2110.03664},
  year   = {2023}
}

备注

20 pages, 13 figures, 8 tables