中文

LLM数学推理中数据能力边界的实证研究

计算与语言 2024-03-05 v1 人工智能 机器学习

摘要

大型语言模型(LLM)在数学推理任务中展现出涌现能力,并且通过监督微调(SFT)增强开源LLM的能力越来越受到关注。在本文中,我们旨在探索监督数据的通用数据策略,以帮助优化和扩展数学推理能力。首先,我们通过识别推理路径的最小最优集来确定推理路径增强的能力边界。其次,我们验证了模型的不同能力可以通过混合相应类型数据的最小最优集来累积增强,而我们的模型MMOS在系列基础模型上以更低的构建成本实现了最先进的性能。此外,我们指出GSM-HARD并非真正困难,当今的LLM不再缺乏数值鲁棒性。同时,我们提供了一个用于鲁棒性测试和教育应用的自动问题生成器。我们的代码和数据公开在https://github.com/cyzhh/MMOS。

关键词

引用

@article{arxiv.2403.00799,
  title  = {An Empirical Study of Data Ability Boundary in LLMs' Math Reasoning},
  author = {Zui Chen and Yezeng Chen and Jiaqi Han and Zhijie Huang and Ji Qi and Yi Zhou},
  journal= {arXiv preprint arXiv:2403.00799},
  year   = {2024}
}

备注

33 pages, 5 figures