AGIEval:评估基础模型以人为中心的基准
计算与语言
2023-09-19 v2 人工智能
摘要
评估基础模型应对人类水平任务的一般能力,是其发展与迈向通用人工智能(AGI)应用的重要方面。依赖人工数据集的传统基准可能无法准确代表人类水平的能力。本文引入AGIEval,一种专门设计用于在以人为中心的标准化考试(如大学入学考试、法学院入学考试、数学竞赛与律师资格考)背景下评估基础模型的新基准。我们使用该基准评估了若干最先进的基础模型,包括GPT-4、ChatGPT与Text-Davinci-003。令人印象深刻的是,GPT-4在SAT、LSAT与数学竞赛上超越人类平均表现,在SAT数学测试中达到95%准确率,在中国高考英语测试中达到92.5%准确率。这展示了当代基础模型的卓越性能。相比之下,我们也发现GPT-4在需要复杂推理或特定领域知识的任务上较弱。我们对模型能力(理解、知识、推理与计算)的 comprehensive 分析揭示了这些模型的优势与局限,为提升其一般能力的未来方向提供了宝贵见解。通过聚焦于与人类认知和决策相关的任务,我们的基准对基础模型在真实场景中的表现提供了更有意义且稳健的评估。数据、代码与所有模型输出发布于 https://github.com/ruixiangcui/AGIEval。
引用
@article{arxiv.2304.06364,
title = {AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models},
author = {Wanjun Zhong and Ruixiang Cui and Yiduo Guo and Yaobo Liang and Shuai Lu and Yanlin Wang and Amin Saied and Weizhu Chen and Nan Duan},
journal= {arXiv preprint arXiv:2304.06364},
year = {2023}
}
备注
19 pages