FineMath:面向中文大语言模型的细粒度数学评估基准
计算与语言
2024-09-09 v2 人工智能
摘要
为了全面评估大语言模型(LLMs)的数学推理能力,我们需要精心策划涵盖不同数学概念和不同难度级别数学问题的评估数据集。为追求这一目标,本文提出了 FineMath,一个用于评估中文 LLMs 的细粒度数学评估基准数据集。FineMath 旨在涵盖小学数学中教授的主要关键数学概念,这些概念被进一步划分为 17 类数学应用题,从而能够对 LLMs 的数学推理能力进行深入分析。所有 17 类数学应用题均根据求解这些问题所需的推理步骤数手动标注了难度级别。我们在 FineMath 上对广泛的 LLMs 进行了大量实验,发现中文 LLMs 在数学推理能力方面仍有相当大的提升空间。我们还对先前被忽视的评估过程和方法进行了深入分析。这两个因素显著影响了模型结果以及我们对它们数学推理能力的理解。该数据集将很快公开发布。
引用
@article{arxiv.2403.07747,
title = {FineMath: A Fine-Grained Mathematical Evaluation Benchmark for Chinese Large Language Models},
author = {Yan Liu and Renren Jin and Ling Shi and Zheng Yao and Deyi Xiong},
journal= {arXiv preprint arXiv:2403.07747},
year = {2024}
}