中文

MLReplicate:面向机器学习可重复性的自主研究系统基准

机器学习 2026-05-19 v1

摘要

能够生成完整科学手稿的自主研究系统已迅速发展,但鲁棒且符合现实需求的评估框架未能跟上。为填补这一差距,我们引入了 MLReplicate,一个用于评估自主研究系统在机器学习可重复性方面表现的端到端基准。该基准由 ICML 2025 杰出论文改编为标准化输入规范,评估 6 个最先进的研究系统:AI SCIENTIST-V1、AI SCIENTIST-V2、AGENT LABORATORY、CYCLERESEARCHER、AI RESEARCHER 和 TINY SCIENTIST,产生 45 篇手稿,其中 3 个实验失败。输出采用双协议方法进行评估,结合自动化会议式审稿和结构化专家人工评估,同时跟踪计算成本、运行时间和所需人工干预量。自动化会议式审稿接受了 37 个有效提交中的 10 个。另外 8 篇提交在审稿前因未达到最低页数要求被退稿。与自动化审稿不同,人工审稿人一致识别出方法论缺陷、幻觉实验结果和可重复性失败,59% 的接受性自动审稿包含虚构或不实质证的论点。我们进一步发现, neither token 预算 也计算成本不能预测输出质量:最便宜的系统在人工评估中超越了最资源密集型的系统,尽管输入标记数相差 38 倍。因此,我们表明,自主研究工作流程的设计比计算规模更为重要。MLReplicate 揭示了当前自主研究系统与真正科学严谨性之间巨大的差距,并建立了一种实用、可扩展的评估框架,以实现可信赖的 AI 驱动科学发现的系统性进展。

关键词

引用

@article{arxiv.2605.16616,
  title  = {MLReplicate: Benchmarking Autonomous Research Systems for Machine Learning Reproducibility},
  author = {Sasi Kiran Gaddipati and Diyana Muhammed and Farhana Keya and Gollam Rabby and Sören Auer},
  journal= {arXiv preprint arXiv:2605.16616},
  year   = {2026}
}