中文

生物医学文献中软件提及的大规模数据集

数字图书馆 2022-09-29 v4 其他定量生物学

摘要

我们描述了 CZ Software Mentions 数据集,一个生物医学论文中软件提及的新数据集。使用训练好的 SciBERT 模型从多个来源提取纯文本软件提及:NIH PubMed Central 收藏集以及各出版商提供给 Chan Zuckerberg Initiative 的论文。该数据集提供来源、上下文和元数据,并对若干提及给出了消歧后的软件实体与链接。我们从 NIH PMC-OA Commercial 子集的 240 万篇论文中提取出 112 万条唯一字符串软件提及,从 NIH PMC-OA Non-Commercial 子集(均于 2021 年 10 月收集)提取出 48.1 万条唯一提及,从出版商收藏集的 300 万篇论文中提取出 93.4 万条唯一提及。论文中软件被提及的方式以及 NER 算法的提取结果存在变异。我们提出一种基于聚类的消歧算法,将纯文本软件提及映射到不同的软件实体,并将其应用于 NIH PubMed Central Commercial 收藏集。通过该方法,我们将 NER 模型提取的 112 万条唯一字符串消歧为 97600 个唯一软件实体,覆盖全部软件-论文链接的 78%。我们将其中 18.5 万条提及链接到代码仓库,覆盖约 55% 的软件-论文链接。我们详述了构建数据集、消歧与链接软件提及的过程,以及如此规模数据集带来的机遇与挑战。我们公开所有数据与代码,作为帮助评估软件(尤其是科学开源项目)对科学影响的新资源。

关键词

引用

@article{arxiv.2209.00693,
  title  = {A large dataset of software mentions in the biomedical literature},
  author = {Ana-Maria Istrate and Donghui Li and Dario Taraborelli and Michaela Torkar and Boris Veytsman and Ivana Williams},
  journal= {arXiv preprint arXiv:2209.00693},
  year   = {2022}
}