中文

ReviewRL:基于强化学习的自动化科学评审

计算与语言 2025-08-15 v1 人工智能

摘要

同行评审对科学进步至关重要,但由于投稿量不断增加和审稿人疲劳,正面临日益严峻的挑战。现有的自动化评审方法在事实准确性、评分一致性和分析深度方面存在困难,常常生成缺乏高质量人工评审所特有洞察力的肤浅或通用反馈。我们引入了ReviewRL,这是一个用于生成全面且基于事实的科学论文评审的强化学习框架。我们的方法结合了:(1) 一个ArXiv-MCP检索增强的上下文生成流水线,整合相关科学文献;(2) 监督微调,建立基础评审能力;以及 (3) 一个带有复合奖励函数的强化学习过程,共同提升评审质量和评分准确性。在ICLR 2025论文上的实验表明,ReviewRL在基于规则的指标和基于模型的质量评估上均显著优于现有方法。ReviewRL为科学发现中强化学习驱动的自动批判生成建立了一个基础框架,展示了该领域未来发展的巨大潜力。ReviewRL的实现将在GitHub上发布。

关键词

引用

@article{arxiv.2508.10308,
  title  = {ReviewRL: Towards Automated Scientific Review with RL},
  author = {Sihang Zeng and Kai Tian and Kaiyan Zhang and Yuru wang and Junqi Gao and Runze Liu and Sa Yang and Jingxuan Li and Xinwei Long and Jiaheng Ma and Biqing Qi and Bowen Zhou},
  journal= {arXiv preprint arXiv:2508.10308},
  year   = {2025}
}

备注

13 pages, 5 figures