中文

评估大语言模型在高考基准上的性能

计算与语言 2024-02-27 v3 人工智能

摘要

大语言模型(LLMs)已在各种自然语言处理任务中展现出显著性能;然而,如何全面且准确地评估其性能成为一个亟待解决的问题。本文引入 GAOKAO-Bench,一个直观的基准,采用中国高考考试中的题目作为测试样本,包括主观题与客观题。为与人类考试方法对齐,我们设计了一种基于零样本设置的方法来评估 LLMs 的性能。通过人工评估,我们获得了 LLMs(包括 GPT-4、ChatGPT 和 ERNIE-Bot)的折算总分。我们的发现揭示,LLMs 在中国高考中已取得具竞争力的分数,但在不同学科间表现出显著性能差异。我们还使用 LLMs 对主观题评分,并发现模型分数与人类分数达到中等水平的一致性。总之,本研究为未来大语言模型贡献了一个稳健的评估基准,并提供了关于此类模型优势与局限性的宝贵见解。

关键词

引用

@article{arxiv.2305.12474,
  title  = {Evaluating the Performance of Large Language Models on GAOKAO Benchmark},
  author = {Xiaotian Zhang and Chunyang Li and Yi Zong and Zhengyu Ying and Liang He and Xipeng Qiu},
  journal= {arXiv preprint arXiv:2305.12474},
  year   = {2024}
}