中文

ConceptMath:面向大语言模型数学推理评估的双语概念级基准

计算与语言 2024-02-26 v2 人工智能

摘要

本文介绍了 ConceptMath,一个双语(英语和中文)、细粒度的基准,用于评估大语言模型(LLM)的概念级数学推理。与以平均准确率评估一般数学推理的传统基准不同,ConceptMath 将数学问题系统地组织在数学概念的层级结构下,从而可以通过概念级准确率在不同粒度上评估数学推理。基于我们的 ConceptMath,我们评估了广泛的 LLM,我们观察到现有的 LLM 尽管在传统基准上取得了很高的平均准确率,但在不同数学概念上表现出显著的性能差异,甚至可能在最基本的概念上出现灾难性失败。此外,我们还引入了一种高效的微调策略来增强现有 LLM 的薄弱环节。最后,我们希望 ConceptMath 能够指导开发者了解其模型细粒度的数学能力,并促进基础模型的发展。

关键词

引用

@article{arxiv.2402.14660,
  title  = {ConceptMath: A Bilingual Concept-wise Benchmark for Measuring Mathematical Reasoning of Large Language Models},
  author = {Yanan Wu and Jie Liu and Xingyuan Bu and Jiaheng Liu and Zhanhui Zhou and Yuanxing Zhang and Chenchen Zhang and Zhiqi Bai and Haibin Chen and Tiezheng Ge and Wanli Ouyang and Wenbo Su and Bo Zheng},
  journal= {arXiv preprint arXiv:2402.14660},
  year   = {2024}
}

备注

The benchmark dataset will be released soon