通用 7B 语言模型已具备强数学能力
计算与语言
2024-03-08 v1 人工智能
摘要
此前人们认为,数学能力只有在非常大参数规模的通用语言模型中才会出现,或者需要进行大量与数学相关的预训练。本文表明,具有通用预训练的 LLaMA-2 7B 模型已经展现出强大的数学能力,其证据是在 GSM8K 和 MATH 基准测试中,从 256 次随机生成中选择最佳回答时,分别达到了 97.7% 和 72.0% 的惊人准确率。当前基础模型的主要问题在于难以持续引出其固有的数学能力。值得注意的是,首个回答的准确率在 GSM8K 和 MATH 基准测试上分别降至 49.5% 和 7.9%。我们发现,简单地扩大 SFT 数据规模可以显著提高生成正确答案的可靠性。然而,公开可用数学题目的稀缺性限制了大规模扩展的潜力。为了克服这一限制,我们采用了合成数据,事实证明其效果几乎与真实数据相当,并且在扩展到约一百万个样本时没有表现出明显的饱和现象。这种直接的方法在使用 LLaMA-2 7B 模型时,在 GSM8K 上达到了 82.6% 的准确率,在 MATH 上达到了 40.6% 的准确率,分别比之前的模型提高了 14.2% 和 20.8%。我们还提供了关于不同推理复杂度和错误类型下扩展行为的见解。
引用
@article{arxiv.2403.04706,
title = {Common 7B Language Models Already Possess Strong Math Capabilities},
author = {Chen Li and Weiqi Wang and Jingcheng Hu and Yixuan Wei and Nanning Zheng and Han Hu and Zheng Zhang and Houwen Peng},
journal= {arXiv preprint arXiv:2403.04706},
year = {2024}
}