中文

SuperCLUE:一个综合性的中文大语言模型基准

计算与语言 2023-07-28 v1 人工智能

摘要

大语言模型(LLMs)已展现出融入人类日常生活的潜力。因此,用户偏好是评估LLMs在真实场景中所能取得表现的最关键准则。然而,现有基准主要关注使用多选题来衡量模型的准确性,这限制了对它们在真实应用中能力的理解。我们通过提出一个综合性的中文基准SuperCLUE来填补这一空白,其命名源于另一个流行的中文LLM基准CLUE。SuperCLUE包含三个子任务:源自LLM对战平台(CArena)的真实用户查询与评分、具有单轮与多轮对话的开放式问题(OPEN),以及与开放式单轮问题具有相同题干的封闭式问题(CLOSE)。我们的研究表明,封闭式问题上的准确性不足以反映开放式问题上所达成的人类偏好,同时二者可相互补充以预测真实用户偏好。我们还证明,GPT-4是可靠评判者,可自动评估中文语境下开放式问题的人类偏好。我们的基准将在 https://www.CLUEbenchmarks.com 发布。

关键词

引用

@article{arxiv.2307.15020,
  title  = {SuperCLUE: A Comprehensive Chinese Large Language Model Benchmark},
  author = {Liang Xu and Anqi Li and Lei Zhu and Hang Xue and Changtai Zhu and Kangkang Zhao and Haonan He and Xuanwei Zhang and Qiyue Kang and Zhenzhong Lan},
  journal= {arXiv preprint arXiv:2307.15020},
  year   = {2023}
}

备注

13 pages, 12 figures, 5 tables