中文

ARA:面向科学同行评估的代理可重复性评估

数字图书馆 2026-05-18 v2 机器学习

摘要

科学同行评估日益难以在现代研究产出的规模和复杂性下评估可重复性。评估可重复性需要重建实验依赖关系、方法选择、数据流以及结果生成过程,往往超出人类评审的能力范围。代理可重复性评估(ARA)将可重复性评估正式化为对科学文档进行结构化推理任务。给定论文,ARA 从中提取关联源码、方法、实验与输出的有向工作流图,然后通过结构化和内容基准评估其可重构性,从而进行可重复性评估。在 213 篇 ReScience C 文章(迄今为止最大规模的人类验证可重复性研究基准)上进行实验,展示了 ARA 在不同 LLM、模型温度和科学领域下的普适性和一致的工作流重建与评估能力。ARA 在三个基准上的准确率约为 61%,在 ReproBench(60.71% vs. 36.84%)和 GoldStandardDB(61.68% vs. 43.56%)上取得最高准确率,凸显了其在规模化同行评估中补充人类评审的潜力,推动了下一代同行评估的发展。代码与数据已公开:https://github.com/AndresLaverdeMarin/agentic_reproducibility_assessment

关键词

引用

@article{arxiv.2605.02651,
  title  = {ARA: Agentic Reproducibility Assessment For Scalable Support Of Scientific Peer-Review},
  author = {Kevin Riehl and Andres L. Marin and Nikofors Zacharof and Fan Wu and Patrick Langer and Robert Jakob and Anastasios Kouvelas and Georgios Fontaras and Michail A. Makridis},
  journal= {arXiv preprint arXiv:2605.02651},
  year   = {2026}
}