FAIR Jupyter:基于知识图谱的语义共享与计算笔记本可复现性数据集的粒度探索方法
计算工程、金融与科学
2025-01-07 v1
摘要
数据共享的方式会影响其效用和可重用性。在此,我们展示了如何通过知识图谱将我们先前批量共享的数据进一步盘活,从而允许进行更细粒度的探索和查询。原始数据集关于与生物医学出版物相关联的、托管在 GitHub 上的 Jupyter 笔记本的计算可复现性。它包含关于出版物、相关 GitHub 仓库和 Jupyter 笔记本以及笔记本可复现性的丰富元数据。我们提取该数据集,将其转换为语义三元组,并将这些三元组加载到三元组存储库中以创建知识图谱 FAIR Jupyter,我们通过 Web 服务使其可被访问。这使得能够通过针对特定用例定制的查询来进行细粒度的数据探索和分析。此类查询可以提供关于原始数据集中任何变量的详细信息,突出它们之间的关系,或者将图谱中的部分内容与来自相应外部资源的材料相结合。我们提供了一系列示例查询,以解决研究和教育中的各种用例。我们还概述了如何单独或按类使用此类查询集来刻画特定内容类型的特征。最后,我们讨论了这种语义增强的复杂数据集共享如何既能增强其 FAIR 性(即可发现性、可访问性、互操作性和可重用性),又能帮助识别和传达最佳实践,特别是在数据质量、标准化、自动化和可复现性方面。
引用
@article{arxiv.2404.12935,
title = {FAIR Jupyter: a knowledge graph approach to semantic sharing and granular exploration of a computational notebook reproducibility dataset},
author = {Sheeba Samuel and Daniel Mietchen},
journal= {arXiv preprint arXiv:2404.12935},
year = {2025}
}