社会科学中软件使用情况的调查:一种知识图谱方法
信息检索
2021-08-30 v2 计算与语言
摘要
关于科学调查中使用的软件的知识出于多种原因是必要的,包括结果的溯源、衡量软件影响以归属开发者,以及总体的文献计量软件引用分析。此外,提供关于软件及源代码是否可用以及如何可用的信息,使得能够评估开源软件在科学中的总体状况与作用。虽然此类分析可手动进行,但大规模分析需要应用自动化的信息抽取与关联方法。在本文中,我们提出 SoftwareKG——一个包含来自社会科学超过 51,000 篇科学文章中软件提及信息的知识图谱。通过远程与弱监督方法创建的银标准语料库,以及手动标注创建的金标准语料库,被用于训练基于 LSTM 的神经网络以识别科学文章中的软件提及。该模型在精确匹配中达到 .82 F-score 的识别率。结果我们识别出超过 133,000 条软件提及。对于实体消歧,我们使用了公共领域知识库 DBpedia。此外,我们将知识图谱的实体链接到其他知识库,如 Microsoft Academic Knowledge Graph、Software Ontology 和 Wikidata。最后,我们展示了 SoftwareKG 如何被用于评估软件在社会科学中的作用。
引用
@article{arxiv.2003.10715,
title = {Investigating Software Usage in the Social Sciences: A Knowledge Graph Approach},
author = {David Schindler and Benjamin Zapilko and Frank Krüger},
journal= {arXiv preprint arXiv:2003.10715},
year = {2021}
}
备注
Preprint of a full paper at Extended Semantic Web Conference (ESWC 2020), 16 pages, 4 figures