PaperRepro:面向社会科学论文的自动计算可重复性评估
计算机与社会
2026-03-03 v1 人工智能
摘要
计算可重复性对科学发现的可信度至关重要,尤其是在社会科学中,后者常常影响现实决策。手动进行可重复性评估成本高昂且耗时,因为使用作者公开的代码和数据复现报告结果并非易事。近期大模型的进展激发了基于代理的自动可重复性评估方法。然而,现有方法常因上下文容量有限、工具不具任务针对性以及结果捕获不足而受限。为此,我们提出PaperRepro,一种新型两阶段、多代理方法,将执行与评估分离。在执行阶段,代理执行复现软件包并编辑代码以捕获复现结果作为显式制品。在评估阶段,代理使用显式证据进行可重复性评估。PaperRepro 为代理分配distinct职责,配备任务特定工具和专家提示,缓解了上下文和工具的限制。它进一步最大化了大模型的编码能力,以实现更完整的结果捕获。实验表明,在 REPRO-Bench 上,PaperRepro 相较于最强先前基线实现了 21.9% 的相对提升。我们进一步细化了基准,引入 REPRO-Bench-S,按执行难度分层,以便更诊断性地评估自动可重复性评估系统。我们的代码和数据已公开开放。
关键词
引用
@article{arxiv.2603.00058,
title = {PaperRepro: Automated Computational Reproducibility Assessment for Social Science Papers},
author = {Linhao Zhang and Tong Xia and Jinghua Piao and Lizhen Cui and Yong Li},
journal= {arXiv preprint arXiv:2603.00058},
year = {2026}
}