大语言模型在算术任务上的表现如何?
计算与语言
2023-04-06 v1 人工智能
摘要
大语言模型已涌现出包括思维链在内的能力,可逐步解答数学应用题。解决数学应用题不仅需要借助思维链拆解问题的能力,还需为每一步正确计算算术表达式。据我们所知,尚无工作专注于评估大语言模型的算术能力。本文中,我们提出一个算术数据集 MATH 401,以测试包括 GPT-4、ChatGPT、InstrctGPT、Galactica 和 LLaMA 在内的最新大语言模型在各种算术表达式上的表现,并对大语言模型的能力提供详细分析。MATH 401 与评估代码发布于 \url{https://github.com/GanjinZero/math401-llm}。
引用
@article{arxiv.2304.02015,
title = {How well do Large Language Models perform in Arithmetic tasks?},
author = {Zheng Yuan and Hongyi Yuan and Chuanqi Tan and Wei Wang and Songfang Huang},
journal= {arXiv preprint arXiv:2304.02015},
year = {2023}
}