TinyGSM:用小语言模型在 GSM8k 上实现 >80% 的准确率
机器学习
2023-12-15 v1 计算与语言
摘要
小规模模型提供了多种计算优势,但尺寸对于问题解决能力的关键程度仍是一个开放性问题。具体而言,对于解决小学数学问题,迄今为止在 GSM8K 基准测试中突破 80% 门槛所需的最小模型尺寸仍为 34B。我们的工作研究了高质量数据集如何成为小语言模型获得数学推理能力的关键。我们引入了 \texttt{TinyGSM},这是一个包含 12.3M 个小学数学问题及其配对 Python 解决方案的合成数据集,完全由 GPT-3.5 生成。在 \texttt{TinyGSM} 上进行微调后,我们发现一个 1.3B 生成模型和一个 1.3B 验证模型的组合可以实现 81.5% 的准确率,优于现有大数个数量级的模型。这也媲美了生成我们模型训练数据的 GPT-3.5“教师”模型(77.4%)的性能。我们的方法简单且包含两个关键组件:1) 高质量数据集 \texttt{TinyGSM},2) 使用验证器从多个候选生成中选择最终输出。
引用
@article{arxiv.2312.09241,
title = {TinyGSM: achieving >80% on GSM8k with small language models},
author = {Bingbin Liu and Sebastien Bubeck and Ronen Eldan and Janardhan Kulkarni and Yuanzhi Li and Anh Nguyen and Rachel Ward and Yi Zhang},
journal= {arXiv preprint arXiv:2312.09241},
year = {2023}
}