SciInstruct:用于训练科学语言模型的自反思指令标注数据集
计算与语言
2024-11-19 v3
摘要
大型语言模型 (LLMs) 在辅助科学发现方面展现出潜力。然而,此类应用目前受限于 LLMs 在理解复杂科学概念、推导符号方程以及解决高级数值计算方面的不足。为弥补这些差距,我们推出了 SciInstruct,这是一套用于训练具备大学水平科学推理能力的科学语言模型的科学指令集。我们方法的核心是一种新颖的自反思指令标注框架,旨在解决科学领域数据稀缺的挑战。该框架利用现有 LLMs 为未标注的科学问题生成逐步推理,随后进行自反思的批评与修订过程。应用此框架,我们构建了一个涵盖物理、化学、数学和形式证明的多样化高质量数据集。我们从多个有趣的角度(如领域、规模、来源、问题类型、答案长度等)分析了 curated 的 SciInstruct。为验证 SciInstruct 的有效性,我们使用 SciInstruct 对不同的语言模型进行了微调,即 ChatGLM3 (6B 和 32B)、Llama3-8B-Instruct 和 Mistral-7B: MetaMath,增强了它们的科学和数学推理能力,同时未牺牲基座模型的语言理解能力。我们在 https://github.com/THUDM/SciGLM 发布了所有代码和 SciInstruct。
引用
@article{arxiv.2401.07950,
title = {SciInstruct: a Self-Reflective Instruction Annotated Dataset for Training Scientific Language Models},
author = {Dan Zhang and Ziniu Hu and Sining Zhoubian and Zhengxiao Du and Kaiyu Yang and Zihan Wang and Yisong Yue and Yuxiao Dong and Jie Tang},
journal= {arXiv preprint arXiv:2401.07950},
year = {2024}
}
备注
Accepted to NeurIPS D&B Track 2024