中文

CycleResearcher:通过自动化评审改进自动化研究

计算与语言 2025-03-11 v3 人工智能 计算机与社会 机器学习

摘要

科学发现的自动化一直是研究界长期追求的目标,由加速知识创造的潜力驱动。虽然在使用商业大型语言模型(LLM)作为研究助手或创意生成器方面取得了显著进展,但使用开源 LLM 自动化整个研究过程的可能性仍基本未被探索。本文探讨了使用开源经过后训练的 LLM 作为自主代理的可行性,这些代理能够执行从文献综述和稿件准备到同行评审和论文优化的完整自动化研究和评审周期。我们的迭代偏好训练框架由 CycleResearcher(执行研究任务)和 CycleReviewer(模拟同行评审过程并通过强化学习提供迭代反馈)组成。为训练这些模型,我们开发了两个新数据集 Review-5k 和 Research-14k,反映了真实的机器学习研究和同行评审动态。我们的结果表明,CycleReviewer 在预测论文评分方面相比个体人类评审员实现了 26.89% 的平均绝对误差(MAE)降低,显示了 LLM 有效辅助专家级研究评估的潜力。在研究方面,CycleResearcher 模型生成的论文在模拟同行评审中获得了 5.36 的分数,与人类专家的预印本水平 5.24 相比在模拟评审分数方面具有一定的竞争力,但与录用论文水平 5.69 相比仍有改进空间。这项工作代表了向完全自动化科学探究迈出的重要一步,提供了伦理保障并探索了 AI 驱动的研究能力。代码、数据集和模型权重发布于 https://wengsyx.github.io/Researcher/。

关键词

引用

@article{arxiv.2411.00816,
  title  = {CycleResearcher: Improving Automated Research via Automated Review},
  author = {Yixuan Weng and Minjun Zhu and Guangsheng Bao and Hongbo Zhang and Jindong Wang and Yue Zhang and Linyi Yang},
  journal= {arXiv preprint arXiv:2411.00816},
  year   = {2025}
}

备注

Accept in ICLR 2025