中文

ScientistOne:通过链式证据实现人类水平自主研究

人工智能 2026-05-27 v1 计算与语言 多智能体系统

摘要

自主研究代理产出竞争性解决方案和专业报纸,但其输出在表面级评估下难以检测到的可验证性失效:虚构引用、不可重现的分数以及方法描述与实现之间的偏差。我们通过三个贡献来解决这一问题。第一,链式证据 (Chain-of-Evidence, CoE),一种要求每个主张可被追溯到其证据来源的可验证性框架。第二,ScientistOne,一种在文献综述、解决方案发现和论文写作过程中持续维护证据链的端到端自主研究系统。第三,CoE Audit,一种事后审计,其四项完整性检查——得分验证、规范违规、参考验证和方法-代码对齐——对所有系统统一应用。在 75 篇论文涵盖五个系统和五个前沿研究任务的跨系统研究中,所有基线至少存在一种系统性失效模式:虚构引用率达到 21%,得分验证通过率最少为 42%,方法-代码对齐率为 20%--80%。ScientistOne 实现了零虚构引用 (0/337)、完美得分验证 (12/12) 和最高的方法-代码对齐率 (14/15),在所有五个任务中匹配或超越人类专家性能。ScientistOne 还推广到额外六个任务,涵盖医学影像、细粒度识别、3D 感知和语言建模,在 Parameter Golf 和 MLE-Bench 任务中实现了最佳性能,甚至在基线完全失败的任务中赢得了金牌。

关键词

引用

@article{arxiv.2605.26340,
  title  = {ScientistOne: Towards Human-Level Autonomous Research via Chain-of-Evidence},
  author = {Rui Meng and Bhavana Dalvi Mishra and Jiefeng Chen and Chun-Liang Li and Palash Goyal and Mihir Parmar and Yiwen Song and Yale Song and Rajarishi Sinha and Parthasarathy Ranganathan and Burak Gokturk and Jinsung Yoon and Tomas Pfister},
  journal= {arXiv preprint arXiv:2605.26340},
  year   = {2026}
}

备注

Project website: https://scientist-one.github.io/