大型语言模型在小学数学运算上表现的严谨审视
计算与语言
2024-11-26 v4 人工智能
机器学习
摘要
大型语言模型(LLMs)在许多数学推理基准测试中取得了显著成功。然而,人们日益担忧其中部分性能实际上反映了数据集污染,即与基准测试问题高度相似的数据泄露到训练数据中,而非真正的推理能力。为严格验证这一说法,我们构建了小学数学1000题(GSM1k)。GSM1k旨在模仿成熟GSM8k基准的风格和复杂度,后者是衡量基础数学推理能力的黄金标准。我们确保这两个基准在人类解答率、解题步骤数、答案量级等关键指标上具有可比性。在GSM1k上评估领先的开源和闭源LLMs时,我们观察到准确率下降高达8%,且多个模型系列在几乎所有模型规模上都显示出系统性过拟合的迹象。进一步分析表明,模型生成GSM8k样本的概率与其在GSM8k和GSM1k上的性能差距之间存在正相关关系(Spearman's r^2 = 0.36),这表明一些模型可能部分记忆了GSM8k。尽管如此,许多模型,尤其是前沿模型,显示出极少的过拟合迹象,并且所有模型都普遍展现出对训练数据中未出现的新数学问题的泛化能力。
关键词
引用
@article{arxiv.2405.00332,
title = {A Careful Examination of Large Language Model Performance on Grade School Arithmetic},
author = {Hugh Zhang and Jeff Da and Dean Lee and Vaughn Robinson and Catherine Wu and Will Song and Tiffany Zhao and Pranav Raja and Charlotte Zhuang and Dylan Slack and Qin Lyu and Sean Hendryx and Russell Kaplan and Michele Lunati and Summer Yue},
journal= {arXiv preprint arXiv:2405.00332},
year = {2024}
}
备注
2024 NeurIPS Camera Ready (Datasets and Benchmarks Track)