Jr. AI 科学家及其风险报告:基于基线论文的自主科学探索
人工智能
2026-03-13 v4 计算与语言
计算机视觉与模式识别
机器学习
摘要
理解 AI 科学家系统(autoresearch)的当前能力与风险,对确保可信赖且可持续的 AI 驱动科学进步,同时维护学术生态系统的完整性至关重要。为此,我们开发了 Jr. AI 科学家,这是一个最先进的自主 AI 科学家系统,模拟了新手研究生研究工作流程:给定人类导师提供的基线论文,它分析论文的局限性,提出新颖的改进假设,通过迭代实验直至实现改进,并撰写结果论文。不同于假设完全自动化或仅作用于小规模代码的先前方法,Jr. AI 科学家遵循明确定义的研究工作流程,并利用现代编码代理处理复杂的多文件实现,从而产生具有科学价值的贡献。通过我们的实验,Jr. AI 科学家成功生成了基于真实 NeurIPS、IJCV 和 ICLR 作品提出并实现新方法的研究论文。对于评估,我们采用了 AI 评审家自动评估、作者主导的评估以及提交至 Agents4Science 的评估——该场地专注于 AI 驱动贡献。我们的发现表明,Jr. AI 科学家生成的论文在 DeepReviewer 评分高于现有完全自动化系统。然而,我们从作者评估和 Agents4Science 评论中识别出重要局限性,表明直接应用当前 AI 科学家系统存在潜在风险,且未来研究仍面临关键挑战。最后,我们全面报告了在开发期间识别出的各种风险。我们认为本研究阐明了 AI 科学家系统的当前角色与局限,为哪些仍需人类专长的领域以及随着这些系统演进可能出现的风险提供了洞见。
引用
@article{arxiv.2511.04583,
title = {Jr. AI Scientist and Its Risk Report: Autonomous Scientific Exploration from a Baseline Paper},
author = {Atsuyuki Miyai and Mashiro Toyooka and Takashi Otonari and Zaiying Zhao and Kiyoharu Aizawa},
journal= {arXiv preprint arXiv:2511.04583},
year = {2026}
}
备注
TMLR2026. Issues, comments, and questions are all welcome in https://github.com/Agent4Science-UTokyo/Jr.AI-Scientist