中文

CJEval:基于中国中考数据评估大型语言模型的基准

人工智能 2024-09-26 v2

摘要

在线教育平台通过提供动态的数字化基础设施,极大地改变了教育资源的传播方式。随着这一转变的进一步深化,大型语言模型(LLMs)的出现提升了这些平台的智能化水平。然而,当前学术基准对现实工业场景的指导作用有限。这种局限性源于教育应用所需的不仅仅是单纯的试题解答。为了弥合这一差距,我们引入了 CJEval,一个基于中国初中考试评估的基准。CJEval 包含 26,136 个样本,涵盖四个应用级教育任务和十个学科。这些样本不仅包含问题和答案,还包含详细的标注,如题型、难度级别、知识概念和答案解析。利用该基准,我们评估了 LLMs 的潜在应用,并通过对各种教育任务进行微调,对其性能进行了全面分析。大量的实验和讨论突出了在教育领域应用 LLMs 的机遇与挑战。

关键词

引用

@article{arxiv.2409.16202,
  title  = {CJEval: A Benchmark for Assessing Large Language Models Using Chinese Junior High School Exam Data},
  author = {Qian-Wen Zhang and Haochen Wang and Fang Li and Siyu An and Lingfeng Qiao and Liangcai Gao and Di Yin and Xing Sun},
  journal= {arXiv preprint arXiv:2409.16202},
  year   = {2024}
}