中文

构建 CORD-19 疫苗数据集

计算与语言 2024-07-29 v1 信息检索 机器学习

摘要

我们介绍新的数据集 'CORD-19-Vaccination' 以满足专门关注新冠疫苗相关研究的科学家之需。该数据集从CORD-19数据集中提取,并添加了语言细节、作者人口学信息、关键词和每篇论文的主题等新列。采用Facebook fastText模型识别语言。为建立作者人口学信息(作者所属机构、实验室/机构位置和实验室/机构国家列),我们处理每篇论文的JSON文件,并进一步利用Google搜索API确定国家值。采用Yake从论文标题、摘要和正文中提取关键词,使用LDA(潜在 Dirichlet 分配)算法添加主题信息。为评估该数据集,我们演示了类似CORD-19 Kaggle挑战中使用的问答任务。为进一步评估,对每篇论文的摘要进行顺序句子分类,使用Dernoncourt等人的模型。我们对训练数据集进行部分手工标注,并使用预训练的BERT-PubMed层。'CORD-19-Vaccination'包含3万篇研究论文,对NLP研究如文本挖掘、信息抽取和问答等在新冠疫苗研究领域具有巨大价值。

关键词

引用

@article{arxiv.2407.18471,
  title  = {Constructing the CORD-19 Vaccine Dataset},
  author = {Manisha Singh and Divy Sharma and Alonso Ma and Bridget Tyree and Margaret Mitchell},
  journal= {arXiv preprint arXiv:2407.18471},
  year   = {2024}
}