中文

一个面向生物医学的自动标注 Twitter COVID-19 数据集

信息检索 2021-07-28 v1 社会与信息网络

摘要

近年来,利用 Twitter 等社交媒体数据进行生物医学研究的情况逐渐增多。在 COVID-19 大流行期间,研究人员转向更多非传统的临床数据源,以近实时地刻画该疾病、研究干预措施的社会影响,以及康复 COVID-19 病例所表现的后遗症(Long-COVID)。然而,由于人工标注成本高昂且识别正确文本需耗费大量精力,人工策划的社交媒体数据集难以获取。即便有数据集可用,它们通常规模很小,且其标注随时间推移或面对更大量文档时泛化性不佳。作为 2021 年生物医学关联标注黑客松(Biomedical Linked Annotation Hackathon)的一部分,我们发布了超过 1.2 亿条自动标注推文的数据集,用于生物医学研究。结合最佳实践,我们识别出具有潜在高临床相关性的推文。我们通过将若干基于 SpaCy 的标注框架与人工标注的黄金标准数据集进行比较来评估我们的工作。选出用于自动标注的最佳方法后,我们标注了 1.2 亿条推文并公开发布,供生物医学领域未来的下游使用。

关键词

引用

@article{arxiv.2107.12565,
  title  = {A Biomedically oriented automatically annotated Twitter COVID-19 Dataset},
  author = {Luis Alberto Robles Hernandez and Tiffany J. Callahan and Juan M. Banda},
  journal= {arXiv preprint arXiv:2107.12565},
  year   = {2021}
}

备注

8 Pages, 3 tables