中文

MuMath-Code:基于多视角数据增强结合工具型大语言模型的数学推理

计算与语言 2024-05-14 v1 人工智能

摘要

集成外部 Python 解释器的工具型大语言模型(LLM)显著提升了开源 LLM 的数学推理能力,而无工具方法则选择另一条轨道,通过增强数学推理数据来实现。然而,如何将上述两种研究路径相结合,发挥两者优势的有效方法仍待探索。本文首先通过多视角数据增强方法引入新的数学问题,然后合成包含代码的解答。对开源 LLM(如 Llama-2)进行微调以适应增强后的数据集,得到的模型为 MuMath-Code(μ\mu-Math-Code)。在推理阶段,MuMath-Code 生成代码并与外部 Python 解释器交互以获取执行结果。因此,MuMath-Code 利用了外部工具和数据增强的优势。为充分发挥增强数据的优势,我们提出了两阶段训练策略:在阶段 1 中,对 Llama-2 进行基于纯思考链(CoT)数据的微调,以获得中间模型;在阶段 2 中,对该中间模型进行包含代码嵌套数据的训练,以获得最终的 MuMath-Code。我们的 MuMath-Code-7B 在 GSM8K 上取得 83.8 分,在 MATH 上取得 52.4 分,而 MuMath-Code-70B 模型在开源方法中实现了新纪录的表现——在 GSM8K 上取得 90.7%,在 MATH 上取得 55.1%。大量实验验证了工具使用与数据增强的结合,以及我们的两阶段训练策略。我们将提出的数据集及相关代码公开供大家使用。

关键词

引用

@article{arxiv.2405.07551,
  title  = {MuMath-Code: Combining Tool-Use Large Language Models with Multi-perspective Data Augmentation for Mathematical Reasoning},
  author = {Shuo Yin and Weihao You and Zhilong Ji and Guoqiang Zhong and Jinfeng Bai},
  journal= {arXiv preprint arXiv:2405.07551},
  year   = {2024}
}

备注

The state-of-the-art open-source tool-use LLMs for mathematical reasoning