中文

大语言模型在算术任务上的表现如何?

计算与语言 2023-04-06 v1 人工智能

摘要

大语言模型已涌现出包括思维链在内的能力,可逐步解答数学应用题。解决数学应用题不仅需要借助思维链拆解问题的能力,还需为每一步正确计算算术表达式。据我们所知,尚无工作专注于评估大语言模型的算术能力。本文中,我们提出一个算术数据集 MATH 401,以测试包括 GPT-4、ChatGPT、InstrctGPT、Galactica 和 LLaMA 在内的最新大语言模型在各种算术表达式上的表现,并对大语言模型的能力提供详细分析。MATH 401 与评估代码发布于 \url{https://github.com/GanjinZero/math401-llm}。

关键词

引用

@article{arxiv.2304.02015,
  title  = {How well do Large Language Models perform in Arithmetic tasks?},
  author = {Zheng Yuan and Hongyi Yuan and Chuanqi Tan and Wei Wang and Songfang Huang},
  journal= {arXiv preprint arXiv:2304.02015},
  year   = {2023}
}