中文

基于相似性度量的 Jupyter 笔记本计算可重复性评估

软件工程 2025-09-30 v1 数据库

摘要

计算可重复性指的是在重新运行实验后获得一致结果。Jupyter Notebook 是一种基于网页的计算笔记本应用程序,便于运行、发布和共享计算实验及其结果。然而,重新运行 Jupyter Notebook 可能并不总是生成相同的结果,这些因素包括随机性、库版本变化或计算环境的差异。本文引入了基于相似性的可重复性指数(Similarity-based Reproducibility Index, SRI)——一种用于评估 Jupyter 笔记本中结果可重复性的度量。SRI 基于针对不同 Python 对象的相似性度量方法开发了新方法,用于将重新运行后的输出与原始输出进行比较。对于每个生成输出的单元格,SRI 报告一个范围为 [0, 1] 的定量分数以及一些定性见解,以评估可重复性。本文还包括一个案例研究,将所提度量应用于一组 Jupyter 笔记本上,展示了如何利用各种相似性度量来量化计算可重复性。

关键词

引用

@article{arxiv.2509.23645,
  title  = {Similarity-Based Assessment of Computational Reproducibility in Jupyter Notebooks},
  author = {A S M Shahadat Hossain and Colin Brown and David Koop and Tanu Malik},
  journal= {arXiv preprint arXiv:2509.23645},
  year   = {2025}
}

备注

10 pages