中文

从公开现有资源中挖掘的用于药物安全应用的大规模 Twitter 数据集

信息检索 2020-04-01 v1 社会与信息网络

摘要

随着自然语言处理(NLP)任务中深度学习模型日益流行,在药物警戒领域,更具体地对于药物不良反应(ADRs)的识别,对此类任务的大规模社交媒体数据集存在固有需求。大多数研究者将大量时间分配于爬取 Twitter 或购买昂贵的预整理数据集,然后由人工手动标注,这些方法无法良好扩展,因为 Twitter 上的数据持续不断地涌入。在本工作中,我们重新利用一个公开可用的包含超过 94 亿条 Tweet 的存档数据集,旨在创建一个非常大的药物使用相关推文数据集。利用文献中现有的手动整理数据集,我们通过机器学习方法验证所筛选推文的相关性,最终得到一个公开可用的包含 1,181,993 百万条推文的数据集供公众使用。我们提供所有代码及详细流程,说明如何提取该数据集以及供研究者使用的所选推文 ID。

关键词

引用

@article{arxiv.2003.13900,
  title  = {A large-scale Twitter dataset for drug safety applications mined from publicly existing resources},
  author = {Ramya Tekumalla and Juan M. Banda},
  journal= {arXiv preprint arXiv:2003.13900},
  year   = {2020}
}

备注

8 tables, 2 figures, 7 pages, accepted after peer review as a workshop paper in ACM Conference on Health, Inference, and Learning (CHIL) 2020 https://www.chilconference.org/agenda/