中文

燮智:一个持续更新的整体领域知识评估基准

计算与语言 2024-03-12 v3

摘要

随着大语言模型(LLMs)的快速发展,迫切需要新的自然语言处理(NLP)基准与之对齐。我们提出了 Xiezhi(燮智),这是为评估整体领域知识而设计的最全面的评测套件。Xiezhi 包含来自 13 个不同学科、涵盖 516 个多样领域的多项选择题,共有 249,587 道题,并附有 Xiezhi-Specialty 和 Xiezhi-Interdiscipline,两者各含 15k 道题。我们对 47 个前沿 LLM 在 Xiezhi 上进行了评估。结果表明,LLM 在科学、工程、农学、医学和艺术方面超越人类平均水平,但在经济、法学、教育学、文学、历史和管理方面表现不足。我们期望 Xiezhi 有助于分析 LLM 的重要优势与不足,该基准已发布于 \url{https://github.com/MikeGu721/XiezhiBenchmark}。

关键词

引用

@article{arxiv.2306.05783,
  title  = {Xiezhi: An Ever-Updating Benchmark for Holistic Domain Knowledge Evaluation},
  author = {Zhouhong Gu and Xiaoxuan Zhu and Haoning Ye and Lin Zhang and Jianchen Wang and Yixin Zhu and Sihang Jiang and Zhuozhi Xiong and Zihan Li and Weijie Wu and Qianyu He and Rui Xu and Wenhao Huang and Jingping Liu and Zili Wang and Shusen Wang and Weiguo Zheng and Hongwei Feng and Yanghua Xiao},
  journal= {arXiv preprint arXiv:2306.05783},
  year   = {2024}
}

备注

Accepted by AAAI 2024