WildSci:基于真实文献推进科学推理
人工智能
2026-01-12 v1 计算与语言
摘要
大语言模型(LLM)推理的最新进展主要集中在数学和编程等领域,这些领域拥有丰富的高质量数据和客观的评估指标。相比之下,由于数据集覆盖范围有限以及开放式科学问题固有的复杂性,LLM 推理模型在医学和材料科学等科学领域的进展仍然受限。为应对这些挑战,我们引入了 WildSci,一个从同行评审文献中自动合成的、针对特定领域的科学问题新数据集,涵盖 9 个科学学科和 26 个子领域。通过将复杂的科学推理任务构建为多项选择题格式,我们能够利用定义明确的奖励信号进行可扩展的训练。我们进一步应用强化学习在这些数据上微调模型,并分析由此产生的训练动态,包括特定领域的性能变化、响应行为和泛化趋势。在一系列科学基准上的实验证明了我们数据集和方法的有效性。我们发布 WildSci 以推动科学推理领域可扩展且可持续的研究,数据集可在 https://huggingface.co/datasets/JustinTX/WildSci 获取。
引用
@article{arxiv.2601.05567,
title = {WildSci: Advancing Scientific Reasoning from In-the-Wild Literature},
author = {Tengxiao Liu and Deepak Nathani and Zekun Li and Kevin Yang and William Yang Wang},
journal= {arXiv preprint arXiv:2601.05567},
year = {2026}
}