CHAMP:用于细粒度分析大语言模型数学推理能力的竞赛级数据集
计算与语言
2024-06-11 v2 人工智能
机器学习
摘要
近期的大型语言模型(LLMs)在具有挑战性的竞赛级问题上显示出数学推理能力的迹象,尤其是在自我生成中间推理步骤的口语化表达(即思维链提示)时。然而,当前的评估主要关注端到端的最终答案正确性,尚不清楚 LLMs 能否利用有益的辅助信息,如特定于问题的提示。本文提出了一个具有挑战性的基准数据集以实现此类分析。概念与提示标注数学问题集(CHAMP)包含高中数学竞赛问题,并标注了概念(即一般数学事实)和提示(即特定于问题的技巧)。这些标注使我们能够探索额外信息的影响,例如相关提示、误导性概念或相关问题。该基准难度很高,在标准设置下,最佳模型的得分仅为 58.1%。有了概念和提示后,性能有时会提高,表明某些模型能够利用此类辅助信息。此外,我们标注了模型生成的解答的正确性。利用此语料库,我们发现模型经常通过错误的推理步骤得出正确的最终答案。此外,我们测试了模型是否能够验证这些解答,发现大多数模型都难以做到。
引用
@article{arxiv.2401.06961,
title = {CHAMP: A Competition-level Dataset for Fine-Grained Analyses of LLMs' Mathematical Reasoning Capabilities},
author = {Yujun Mao and Yoon Kim and Yilun Zhou},
journal= {arXiv preprint arXiv:2401.06961},
year = {2024}
}
备注
ACL 2024 (Findings). Project website at https://yujunmao1.github.io/CHAMP/