BillionCOV:用于高效水合处理的亿级规模富化 COVID-19 推文集
社会与信息网络
2023-09-13 v2
摘要
COVID-19 大流行引入了诸如社交距离、口罩、隔离、封锁、旅行限制、居家办公/学习以及企业关闭等新规范。疫情的严峻性使人们在社交媒体上,尤其在 Twitter 等微博平台上积极发声。自疫情早期,研究者便持续收集并共享大规模 COVID-19 推文数据集。与第三方共享原始 Twitter 数据受限;用户需对公开数据集中的推文标识符进行水合处理以在本地重建数据集。包含原创推文、转推、引用与回复的亿级规模数据集拥有数十亿推文,水合处理需耗时数月。现有数据集存在比例与冗余相关问题。我们报告称超过 5 亿推文标识符指向已删除或受保护推文。为解决这些问题,本文引入一个富化的全球亿级英语 COVID-19 推文数据集 BillionCOV,其包含 2019 年 10 月至 2022 年 4 月间源自 240 个国家和地区的 14 亿条推文。重要的是,BillionCOV 便于研究者筛选推文标识符以实现高效水合。本文讨论针对一组推文标识符获取原始 Twitter 数据的相关方法,呈现多条推文分布以概览 BillionCOV,最后评述该数据集的潜在用例。
引用
@article{arxiv.2301.11284,
title = {BillionCOV: An Enriched Billion-scale Collection of COVID-19 tweets for Efficient Hydration},
author = {Rabindra Lamsal and Maria Rodriguez Read and Shanika Karunasekera},
journal= {arXiv preprint arXiv:2301.11284},
year = {2023}
}