中文

使用 Rubric 奖励训练 AI 共科学家

机器学习 2025-12-30 v1 计算与语言 人机交互

摘要

AI 共科学家正在成为一种辅助人类研究者实现其研究目标的工具。这些 AI 共科学家的一个关键特性是能够在给定一组目标和约束的情况下生成研究计划。该计划可用于头脑风暴,也可在进一步细化后实施。然而,当前的语言模型在生成遵循所有约束和隐含要求的研究计划方面存在挑战。本文研究如何利用广泛的现有研究论文语料库来训练生成更好研究计划的语言模型。我们通过自动从多个领域的论文中提取研究目标和目标特定的评分标准,构建了一个可扩展且多样的训练语料库。随后通过自评式强化学习训练模型以生成研究计划。初始策略的冻结副本在训练期间充当评分器,利用评分标准创建生成器-验证器之间的差距,从而无需外部人工监督即可实现改进。为验证这一方法,我们与人类专家合作进行了为期 225 小时的研究,专家对我们微调后的 Qwen3-30B-A3B 模型生成的计划在 70% 的研究目标上优于初始模型,并批准了 84% 的自动提取的目标特定评分标准。为评估通用性,我们还将方法扩展到医学论文和新的 arXiv 预印本中的研究目标,评估时使用前沿模型的陪审团。我们的微调在 12-22% 的相对改进和显著的跨领域泛化方面取得成功,即使在执行反馈不可行的医学研究等问题情境下也同样有效。这些发现表明,作为提升通用 AI 共科学家水平的一步,自动化的可扩展训练配方具有潜力。

关键词

引用

@article{arxiv.2512.23707,
  title  = {Training AI Co-Scientists Using Rubric Rewards},
  author = {Shashwat Goel and Rishi Hazra and Dulhan Jayalath and Timon Willi and Parag Jain and William F. Shen and Ilias Leontiadis and Francesco Barbieri and Yoram Bachrach and Jonas Geiping and Chenxi Whitehouse},
  journal= {arXiv preprint arXiv:2512.23707},
  year   = {2025}
}

备注

11 pages in the main paper, total 119 including sample outputs in the Appendix