中文

对ChatGPT在数学应用题上的独立评测

计算与语言 2023-03-01 v2 人工智能 机器学习

摘要

我们研究了商业可用大语言模型(LLM)ChatGPT在来自DRAW-1K数据集的数学应用题(MWP)上的表现。据我们所知,这是首个对ChatGPT的独立评测。我们发现ChatGPT的性能因其是否被要求展示解题过程而发生剧烈变化:在其给出过程时失败率为20%,而不给出时失败率达84%。此外,与先前相比,MWP中若干因素——涉及未知数个数与运算个数——会导致更高的失败概率,我们特别指出(在所有实验中)失败概率随加减法运算数量线性增加。我们还发布了ChatGPT对MWP的响应数据集,以支持进一步刻画LLM性能的工作,并给出了预测ChatGPT能否正确解答MWP的基线机器学习模型。我们已发布由ChatGPT响应组成的数据集,以支持该领域的进一步研究。

关键词

引用

@article{arxiv.2302.13814,
  title  = {An Independent Evaluation of ChatGPT on Mathematical Word Problems (MWP)},
  author = {Paulo Shakarian and Abhinav Koyyalamudi and Noel Ngu and Lakshmivihari Mareedu},
  journal= {arXiv preprint arXiv:2302.13814},
  year   = {2023}
}