中文

ZhuJiu:面向大语言模型的多维度多面向中文评测基准

计算与语言 2023-08-29 v1

摘要

大语言模型(LLMs)前所未有的性能表现需要全面而准确的评估。我们认为,对于 LLMs 的评估,基准需要具备综合性与系统性。为此,我们提出了 ZhuJiu 基准,其具有以下优势:(1)多维度能力覆盖:我们在涵盖 51 个任务的 7 个能力维度上对 LLMs 进行了全面评估。特别地,我们还提出了一个专注于 LLMs 知识能力的新基准。(2)多面向评估方法协同:我们使用 3 种不同但互补的评估方法对 LLMs 进行全面评估,从而确保评估结果的权威性与准确性。(3)综合性中文基准:ZhuJiu 是首个在中文环境下对 LLMs 进行充分评估的基准,同时也提供了同样稳健的英文评估能力。(4)避免潜在数据泄漏:为避免数据泄漏,我们针对 37 个任务专门构建了评估数据。我们对当前 10 个主流 LLMs 进行了评估,并对其结果展开了深入讨论与分析。ZhuJiu 基准与开放参与排行榜已在 http://www.zhujiu-benchmark.com/ 公开发布,我们还提供了演示视频:https://youtu.be/qypkJ89L1Ic。

关键词

引用

@article{arxiv.2308.14353,
  title  = {ZhuJiu: A Multi-dimensional, Multi-faceted Chinese Benchmark for Large Language Models},
  author = {Baoli Zhang and Haining Xie and Pengfan Du and Junhao Chen and Pengfei Cao and Yubo Chen and Shengping Liu and Kang Liu and Jun Zhao},
  journal= {arXiv preprint arXiv:2308.14353},
  year   = {2023}
}