ANGO:面向中文领域生成式语言模型的新一代评测基准
计算与语言
2024-02-22 v2 人工智能
摘要
近年来,各类大语言模型(LLMs)评测数据集不断涌现,但多数存在排名失真和模型能力分析困难的问题。针对这些关切,本文提出了ANGO,一个中文多选题评测基准。ANGO首次提出关键点分类标准,每道题目可对应多个关键点,有效增强了评测结果的可解释性。基于真实人类表现,我们构建了可量化的题目难度标准,将ANGO题目划分为9个难度等级,为模型训练提供了更精准的指导。为最大限度减少数据泄露影响并充分利用ANGO的创新特性,我们设计了专属采样策略和一套支持快速测试集迭代的新型评测框架。实验表明,与现有基准相比,ANGO对模型构成了更强的挑战,并在评测结果中揭示了更多细节。
引用
@article{arxiv.2401.04898,
title = {ANGO: A Next-Level Evaluation Benchmark For Generation-Oriented Language Models In Chinese Domain},
author = {Bingchao Wang},
journal= {arXiv preprint arXiv:2401.04898},
year = {2024}
}