中文

PARAMANU-GANITA: 小型数学语言模型能否在数学推理上与大型语言模型竞争?

计算与语言 2025-03-06 v2 人工智能 机器学习

摘要

本文研究:从零开始对领域特定的小型生成语言模型(SLM)进行领域特定预训练,使用领域专用分词器和思维链(CoT)指令微调,是否能在数学推理上获得与LLM相竞争的性能?其次,这种方法是否环境可持续、高成本效益?为了解决这些问题,我们提出了Paramanu-Ganita,一个208M参数的仅解码器自回归SLM,专注于数学。我们在31.5B token上从零开始预训练了170 A100小时,上下文大小4096,混合数学语料包括网页、源代码、教科书、CoT模板化的StackOverflow问答对、以及我们整理的LaTeX数学讲义。我们还训练了一个数学和代码专用的BPE分词器。我们在MetaMathQA数据集上提出并进行了CoT指令微调。我们的模型Paramanu-Ganita尽管比7B LLM小34倍,但在GSM8K测试准确率上超过通用LLM约30个百分点,甚至超过数学专用LLM 3-23个百分点。在MATH基准上,Paramanu-Ganita超过其他模型6-8个百分点。在LogiQA、MMLU(高中、大学水平)和竞赛级AGIEVAL(AQuA-RAT, SAT-Math)等基准上,Paramanu-Ganita超过其他模型1-4%。我们的模型可在https://huggingface.co/gyanai/paramanu-ganita-208M-hf获取。

关键词

引用

@article{arxiv.2404.14395,
  title  = {PARAMANU-GANITA: Can Small Math Language Models Rival with Large Language Models on Mathematical Reasoning?},
  author = {Mitodru Niyogi and Arnab Bhattacharya},
  journal= {arXiv preprint arXiv:2404.14395},
  year   = {2025}
}