CMATH:你的大语言模型能通过中国小学数学测试吗?
计算与语言
2023-06-30 v1 人工智能
机器学习
摘要
我们提出了中国小学数学应用题(CMATH)数据集,包含 1.7k 道小学级别的数学应用题,带有详细标注,来源于实际的中文练习册和考试。该数据集旨在提供一个基准工具,用于评估以下问题:流行的大语言模型(LLM)的能力对应于小学哪个年级的数学水平?我们评估了多种流行的 LLM,包括商业和开源选项,发现只有 GPT-4 在所有六个小学年级中都取得成功(准确率 60%),而其他模型在不同年级水平失败。此外,我们通过向 CMATH 数据集中的原始问题添加干扰信息来评估几个顶尖 LLM 的鲁棒性。我们的发现表明,GPT-4 能够保持鲁棒性,而其他模型失败。我们期望我们的研究能揭示 LLM 在算术和推理能力上的局限,并促进其持续发展和进步。
引用
@article{arxiv.2306.16636,
title = {CMATH: Can Your Language Model Pass Chinese Elementary School Math Test?},
author = {Tianwen Wei and Jian Luan and Wei Liu and Shuang Dong and Bin Wang},
journal= {arXiv preprint arXiv:2306.16636},
year = {2023}
}