KoLA:细致基准测试大语言模型的世界知识
计算与语言
2024-07-02 v3
摘要
大语言模型(LLMs)前所未有的性能亟需改进评估方法。我们坚信,相较于仅探索LLM能力的广度,细致且周到的设计对于全面、无偏和适用的评估至关重要。鉴于世界知识对LLM的重要性,我们构建了知识导向的LLM评估基准(KoLA),其中我们精心设计了三个关键因素:(1)对于\textbf{能力建模},我们模仿人类认知形成知识相关能力的四级分类体系,涵盖项任务。(2)对于\textbf{数据},为确保公平比较,我们使用LLM普遍预训练的语料Wikipedia以及持续收集的涌现语料,旨在评估处理未见数据和演化知识的能力。(3)对于\textbf{评估标准},我们采用对比系统,包括用于跨任务和模型更好数值可比性的总体标准分数,以及用于自动评估知识创造能力的独特自对比指标。我们评估了个开源和商用LLM,并获得了一些有趣发现。KoLA数据集和开放参与排行榜已在 https://kola.xlore.cn 公开发布,并将持续更新,为开发LLM和知识相关系统提供参考。
引用
@article{arxiv.2306.09296,
title = {KoLA: Carefully Benchmarking World Knowledge of Large Language Models},
author = {Jifan Yu and Xiaozhi Wang and Shangqing Tu and Shulin Cao and Daniel Zhang-Li and Xin Lv and Hao Peng and Zijun Yao and Xiaohan Zhang and Hanming Li and Chunyang Li and Zheyuan Zhang and Yushi Bai and Yantao Liu and Amy Xin and Nianyi Lin and Kaifeng Yun and Linlu Gong and Jianhui Chen and Zhili Wu and Yunjia Qi and Weikai Li and Yong Guan and Kaisheng Zeng and Ji Qi and Hailong Jin and Jinxin Liu and Yu Gu and Yuan Yao and Ning Ding and Lei Hou and Zhiyuan Liu and Bin Xu and Jie Tang and Juanzi Li},
journal= {arXiv preprint arXiv:2306.09296},
year = {2024}
}
备注
Accepted by ICLR 2024