中文

OpenMathInstruct-1:一个包含 180 万条数学指令微调的数据集

计算与语言 2024-11-05 v2 人工智能 机器学习

摘要

最近的工作表明,合成生成的数据集在训练大语言模型 (LLM),特别是获取特定技能方面具有巨大的潜力。当前的大规模数学指令微调数据集,如 MetaMathQA (Yu et al., 2024) 和 MAmmoTH (Yue et al., 2024),是使用具有商业限制许可的闭源 LLM 的输出构建的。限制在这些数据生成流程中使用开源 LLM 的一个关键原因是,最佳闭源 LLM(如 GPT-4)与最佳开源 LLM 之间的数学技能存在巨大差距。基于开源 LLM 的最新进展、我们提出的提示新颖性以及一些暴力扩展策略,我们构建了 OpenMathInstruct-1,这是一个包含 180 万对问题 - 解答的数学指令微调数据集。该数据集通过使用最近发布且许可宽松的 Mixtral 模型,为 GSM8K 和 MATH 这两个流行的数学推理基准合成代码解释器解决方案而构建。我们的最佳模型 OpenMath-CodeLlama-70B 在 OpenMathInstruct-1 的子集上训练,在 GSM8K 上得分为 84.6%,在 MATH 上得分为 50.7%,这与最佳的 gpt 蒸馏模型具有竞争力。我们在商业宽松许可下发布了我们的代码、模型和 OpenMathInstruct-1 数据集。

关键词

引用

@article{arxiv.2402.10176,
  title  = {OpenMathInstruct-1: A 1.8 Million Math Instruction Tuning Dataset},
  author = {Shubham Toshniwal and Ivan Moshkov and Sean Narenthiran and Daria Gitman and Fei Jia and Igor Gitman},
  journal= {arXiv preprint arXiv:2402.10176},
  year   = {2024}
}

备注

Camera-ready version for NeurIPS 2024