迈向 LLM 的科学推理:通过强化学习从专家讨论中训练
人工智能
2025-06-04 v2
摘要
我们研究如何利用专家讨论作为学习信号,教导大型语言模型 (LLMs) 进行科学推理。聚焦于基因组学领域,我们开发了一个自动化流水线来提取可训练数据,并引入了 Genome-Bench,这是一个基于十多年来关于基因组工程的科学论坛讨论构建的新基准。我们的流水线将原始交互转换为适合强化学习的多项选择题格式,并配有 3000 多对高质量问答,涵盖基础生物学、实验故障排除、工具使用等。我们使用强化学习 (RL) 和从合成多项选择题数据集导出的基于规则的奖励信号来微调 LLM,以增强特定领域的推理。结果表明,与基础模型相比,从科学讨论中进行的强化学习在 Genome-Bench 上将模型性能提升了 15% 以上,缩小了开源 LLM 与专家级推理之间的差距。据我们所知,这是首个教导 LLM 从科学讨论中进行推理的端到端流水线,在生物学以外的科学领域具有广阔的泛化潜力。
引用
@article{arxiv.2505.19501,
title = {Toward Scientific Reasoning in LLMs: Training from Expert Discussions via Reinforcement Learning},
author = {Ming Yin and Yuanhao Qu and Ling Yang and Le Cong and Mengdi Wang},
journal= {arXiv preprint arXiv:2505.19501},
year = {2025}
}