生物医学出版物中 Jupyter 笔记本的计算可复现性
数字图书馆
2023-08-16 v1 计算工程、金融与科学
摘要
Jupyter 笔记本便于将可执行代码与其文档和输出捆绑在一个交互式环境中,它们代表了记录和共享计算工作流的一种流行机制。研究的计算方面可复现性是科学可复现性的关键组成部分,但尚未针对与生物医学出版物相关的 Jupyter 笔记本进行大规模评估。我们在两个层面上解决计算可复现性:首先,使用全自动工作流,我们分析了与 PubMed Central 索引的出版物相关的 Jupyter 笔记本的计算可复现性。我们通过挖掘文章全文来识别此类笔记本,在 GitHub 上定位它们,并在尽可能接近原始的环境中重新运行。我们记录了复现成功与异常,并探讨了笔记本可复现性与笔记本或出版物相关变量之间的关系。其次,本研究本身即代表一次可复现性尝试,在两年间对 PubMed Central 使用基本相同的 methodology 两次。在来自 2660 个 GitHub 仓库、关联 3467 篇文章的 27271 个笔记本中,22578 个用 Python 编写,其中包括 15817 个在标准需求文件中声明了依赖项、我们尝试自动重新运行的笔记本。其中 10388 个成功安装了所有声明的依赖项,我们重新运行它们以评估可复现性。其中 1203 个笔记本无任何错误运行通过,包括 879 个产生与原始笔记本报告一致的结果,以及 324 个我们的结果与原报告不同。运行其他笔记本导致了异常。我们聚焦于常见问题,突出趋势,并讨论与生物医学出版物相关的 Jupyter 工作流的潜在改进。
引用
@article{arxiv.2308.07333,
title = {Computational reproducibility of Jupyter notebooks from biomedical publications},
author = {Sheeba Samuel and Daniel Mietchen},
journal= {arXiv preprint arXiv:2308.07333},
year = {2023}
}
备注
arXiv admin note: substantial text overlap with arXiv:2209.04308