MathBench: 使用分层数学基准评估 LLM 的理论与应用熟练度
计算与语言
2024-05-21 v1
摘要
大型语言模型(LLMs)的最新进展展示了其在数学方面的显著提升。然而,诸如 GSM8k 等传统数学基准仅提供单维视角,无法全面评估 LLM 的数学能力。为了弥补这一空白,我们引入了 MathBench,这是一个严格评估大型语言模型数学能力的新基准。MathBench 涵盖了广泛的数学学科,对理论理解和实际解决问题的能力进行了详细评估。该基准从基础算术到大学数学分为五个不同阶段,其结构旨在评估不同知识深度的模型。每个阶段都包含理论问题和应用题,使我们能够衡量模型的数学熟练度及其在实际场景中应用概念的能力。MathBench 旨在增强对 LLM 数学能力的评估,提供其在双语语境下知识理解水平和解决问题能力的细致视角。该项目发布于 https://github.com/open-compass/MathBench 。
引用
@article{arxiv.2405.12209,
title = {MathBench: Evaluating the Theory and Application Proficiency of LLMs with a Hierarchical Mathematics Benchmark},
author = {Hongwei Liu and Zilong Zheng and Yuxuan Qiao and Haodong Duan and Zhiwei Fei and Fengzhe Zhou and Wenwei Zhang and Songyang Zhang and Dahua Lin and Kai Chen},
journal= {arXiv preprint arXiv:2405.12209},
year = {2024}
}
备注
Project: https://github.com/open-compass/MathBench