Chinese SimpleQA:面向大语言模型的中文事实性评估
计算与语言
2024-11-14 v2
摘要
新的大语言模型(LLM)评估基准需要与大型语言模型的快速发展保持一致。在这项工作中,我们提出了 Chinese SimpleQA,这是首个用于评估语言模型回答简短问题的事实性能力的综合性中文基准,Chinese SimpleQA 主要具有五个特性(即中文、多样性、高质量、静态性、易于评估)。具体而言,首先,我们聚焦于中文,涵盖 6 个主要主题和 99 个多样化子主题。其次,我们进行了全面的质量控制流程以实现高质量的问答,其中参考答案是静态的且不可随时间更改。第三,跟随 SimpleQA,问题与答案非常简短,且基于 OpenAI API 的评分过程易于评估。基于 Chinese SimpleQA,我们对现有 LLM 的事实性能力进行了全面评估。最后,我们希望 Chinese SimpleQA 能够指导开发者更好地理解其模型的中文事实性能力,并促进基础模型的成长。
引用
@article{arxiv.2411.07140,
title = {Chinese SimpleQA: A Chinese Factuality Evaluation for Large Language Models},
author = {Yancheng He and Shilong Li and Jiaheng Liu and Yingshui Tan and Weixun Wang and Hui Huang and Xingyuan Bu and Hangyu Guo and Chengwei Hu and Boren Zheng and Zhuoran Lin and Xuepeng Liu and Dekai Sun and Shirong Lin and Zhicheng Zheng and Xiaoyong Zhu and Wenbo Su and Bo Zheng},
journal= {arXiv preprint arXiv:2411.07140},
year = {2024}
}