中文

ChatGPT 的数学能力

机器学习 2023-12-12 v2 人工智能 计算与语言

摘要

我们通过在新方法论下使用公开可用数据集及手工构建数据集测试 ChatGPT(2023年1月9日与2023年1月30日发布的两个版本)与 GPT-4,考察它们的数学能力。与存在大型形式化证明数据库(如 Lean 数学库)的形式数学不同,当前用于基准测试语言模型的自然语言数学数据集要么仅涵盖初等数学,要么规模很小。为此,我们公开发布两个新数据集:GHOSTS 与 miniGHOSTS。这些是由数学领域在职研究人员策划的首批自然语言数据集,其(1)旨在涵盖研究生水平数学,(2)提供语言模型数学能力的整体概览,(3)区分数学推理的多个维度。这些数据集还测试 ChatGPT 与 GPT-4 能否通过模拟数学家日常职业活动中出现的用例,成为专业数学家的有用助手。我们在一系列细粒度性能指标上对模型进行基准测试。针对高等数学,这是迄今最详尽的评估工作。我们发现 ChatGPT 作为数学助手在查询事实、充当数学搜索引擎与知识库接口方面最为成功。GPT-4 还可用于本科水平数学,但在研究生水平难度上失败。与媒体中关于 GPT-4 和 ChatGPT 解题能力的诸多正面报道(一种潜在的选择偏差情形)相反,它们整体数学表现远低于研究生水平。因此,若你的目标是通过 ChatGPT 通过研究生数学考试,抄你普通同学的答案反而更好!

关键词

引用

@article{arxiv.2301.13867,
  title  = {Mathematical Capabilities of ChatGPT},
  author = {Simon Frieder and Luca Pinchetti and Alexis Chevalier and Ryan-Rhys Griffiths and Tommaso Salvatori and Thomas Lukasiewicz and Philipp Christian Petersen and Julius Berner},
  journal= {arXiv preprint arXiv:2301.13867},
  year   = {2023}
}

备注

Added further evaluations on another ChatGPT version and on GPT-4. The GHOSTS and miniGHOSTS datasets are available at https://github.com/xyfrieder/science-GHOSTS