ReproScore:区分研究软件可重复性评估中的准备程度与结果
软件工程
2026-05-14 v1
摘要
数字图书馆精选了数百万个 research software artefacts,却缺乏可扩展的基础设施来评估这些 artefacts 是否仍可执行。现有的自动化评估工具将静态存储库完整性——即存储库包含什么——视为执行成功——即它是否运行——的代理。这我们将其称为准备-结果混合。我们提出了 ReproScore,一个两个层次的框架,显式地将可重复性准备 (RRS) 与可重复性结果 (ROS) 分开结合为覆盖度自适应的复合分数 (RCS)。RRS 包括 26 个子指标,涵盖五个类别;ROS 在沙箱基础设施可用时提供基于执行的探针;社区评分标准将权重优先事项外部化为分带的 YAML 框架。针对来自大规模真实语料库的 423 个 GitHub 存储库进行评估,该语料库涵盖五种故障模式,发现两点互补结果:环境类别在强烈区分故障模式方面发挥了重要作用,确认静态信号捕获了有意义的结构差异;然而 RRS 在二元成功相关性方面几乎为零,实证量化了存储库规模下的准备-结果鸿沟。总的来说,这些发现验证了该架构分离既是必要的,也是非平凡的,使 ReproScore 成为数字图书馆工作流程中面向可重复性的可扩展基础设施。
引用
@article{arxiv.2605.13275,
title = {ReproScore: Separating Readiness from Outcome in Research Software Reproducibility Assessment},
author = {Sheeba Samuel and Daniel Mietchen and Jungsan Kim and Waqas Ahmed and Martin Gaedke},
journal= {arXiv preprint arXiv:2605.13275},
year = {2026}
}