中文

FoundaBench:评估大型语言模型的中文基础知识能力

计算与语言 2024-04-30 v1 人工智能

摘要

在大型语言模型(LLMs)蓬勃发展的领域中,基础知识的评估仍然是一个关键挑战,特别是针对中文语言和文化的模型。本文介绍了FoundaBench,一个旨在严格评估中文LLMs基础知识能力的开创性基准。FoundaBench包含3354道涵盖常识和K-12教育科目的多样化选择题,精心策划以反映日常和学术知识的广度和深度。我们使用FoundaBench对12个最先进的LLMs进行了广泛评估,采用了传统评估方法和我们的CircularEval协议来减轻模型响应中的潜在偏差。我们的结果突显了在中文语料库上预训练的模型的优越性能,并揭示了模型推理和记忆回忆能力之间的显著差距。从FoundaBench评估中获得的见解为理解LLMs的基础知识设定了新标准,为该领域的未来进展提供了稳健的框架。

关键词

引用

@article{arxiv.2404.18359,
  title  = {FoundaBench: Evaluating Chinese Fundamental Knowledge Capabilities of Large Language Models},
  author = {Wei Li and Ren Ma and Jiang Wu and Chenya Gu and Jiahui Peng and Jinyang Len and Songyang Zhang and Hang Yan and Dahua Lin and Conghui He},
  journal= {arXiv preprint arXiv:2404.18359},
  year   = {2024}
}