MegaScience:推动科学推理后训练数据集的前沿
计算与语言
2025-08-28 v2 人工智能
机器学习
摘要
科学推理对于开发人工智能科学家和支持人类研究人员推进自然科学发现的前沿至关重要。然而,开源社区主要关注数学和编码,而忽视了科学领域,这主要是由于缺乏开放、大规模、高质量、可验证的科学推理数据集。为了弥补这一差距,我们首先提出了TextbookReasoning,这是一个开放数据集,包含从12k大学级科学教科书中提取的真实参考答案,包含跨越7个科学学科的65万个推理问题。我们进一步引入了MegaScience,这是一个大规模的高质量开源数据集混合体,总计125万个实例,通过系统的消融研究开发,评估各种数据选择方法,以确定每个公开可用科学数据集的最佳子集。同时,我们构建了一个全面的评估系统,涵盖15个基准测试中的不同学科和问题类型,结合了全面的答案提取策略,以确保准确的评估指标。我们的实验表明,与现有的开源科学数据集相比,我们的数据集以更简洁的响应长度实现了卓越的性能和训练效率。此外,我们在MegaScience上训练了Llama3.1、Qwen2.5和Qwen3系列基础模型,这些模型在平均性能上显著优于相应的官方指令模型。此外,MegaScience对更大更强的模型表现出更高的有效性,表明科学调优具有规模效益。我们将我们的数据整理流程、评估系统、数据集和七个训练好的模型发布给社区,以推进科学推理研究。
引用
@article{arxiv.2507.16812,
title = {MegaScience: Pushing the Frontiers of Post-Training Datasets for Science Reasoning},
author = {Run-Ze Fan and Zengzhi Wang and Pengfei Liu},
journal= {arXiv preprint arXiv:2507.16812},
year = {2025}
}
备注
39 pages; Github: https://github.com/GAIR-NLP/MegaScience; HF: https://huggingface.co/MegaScience