Logics-STEM:通过失败驱动的后训练和文档知识增强提升LLM推理能力
人工智能
2026-01-21 v3
摘要
我们提出Logics-STEM,一个在规模为10M的高质量且多样的Logics-STEM-SFT-Dataset上微调的推理模型,该数据集是规模最大的开源长链思维语料库之一。Logics-STEM针对科学、技术、工程和数学(STEM)领域的推理任务, 在STEM相关基准测试中表现卓越,平均超过规模为8B的参数的次佳模型4.68%。我们将所得 gains归因于我们的数据-算法联合优化引擎,二者被优化以适应推理背后的黄金分布。数据层面,Logics-STEM-SFT-Dataset由精心设计的数据策展引擎构建,包含5个阶段以确保质量、多样性和可扩展性,包括标注、去重、去内容、提炼和分层抽样。算法层面,我们的失败驱动后训练框架利用针对模型失败区域的目标知识检索和数据合成,有效指导第二阶段SFT或强化学习(RL),以更好地适应目标分布。Logics-STEM卓越的实证性能揭示了将大规模开源数据与精心设计的合成数据相结合的广阔潜力,凸显了数据-算法联合设计在通过后训练增强推理能力方面的关键作用。我们公开了Logics-STEM模型(8B和32B)以及Logics-STEM-SFT-Dataset(10M和下采样2.2M版本),以支持开源社区的未来研究。
引用
@article{arxiv.2601.01562,
title = {Logics-STEM: Empowering LLM Reasoning via Failure-Driven Post-Training and Document Knowledge Enhancement},
author = {Mingyu Xu and Cheng Fang and Keyue Jiang and Yuqian Zheng and Yanghua Xiao and Baojian Zhou and Qifang Zhao and Suhang Zheng and Xiuwen Zhu and Jiyang Tang and Yongchi Zhao and Yijia Luo and Zhiqi Bai and Yuchi Xu and Wenbo Su and Wei Wang and Bing Zhao and Lin Qu and Xiaoxiao Xu},
journal= {arXiv preprint arXiv:2601.01562},
year = {2026}
}