GAOKAO-Eval:高分是否真正反映了大型语言模型的强大能力?
计算与语言
2024-12-16 v1 人工智能
摘要
大型语言模型(LLMs)通常使用人工设计的基准进行评估,其前提是更高的分数隐式地反映了更强的人类水平表现。然而,人们越来越担忧LLMs可能因数据泄露而“利用”这些基准,在简单人类任务上表现不佳的同时却获得高分。为了实质性解决这一问题,我们创建了GAOKAO-Eval——一个基于中国全国高考(Gaokao)的综合基准,并对高考前发布的代表性模型进行了“闭卷”评估。与普遍共识相反,即使在解决了数据泄露和全面性问题之后,GAOKAO-Eval仍揭示高分并不能真正反映与人类对齐的能力。为更好地理解这种不匹配,我们引入认知心理学中的Rasch模型来分析LLM评分模式,并识别出两个关键差异:1)在各种题目难度下异常一致的表现,2)同等难度题目下表现的高方差。此外,我们发现LLM生成答案在教师之间存在评分不一致以及反复出现的错误模式。我们发现这些现象与OpenAI o1的动机密切相关,而o1的“推理即困难”方法可以缓解这种不匹配。这些结果表明GAOKAO-Eval能够揭示当前基准未能捕捉到的LLM能力局限性,并强调需要更多与LLM对齐的难度分析。
引用
@article{arxiv.2412.10056,
title = {GAOKAO-Eval: Does high scores truly reflect strong capabilities in LLMs?},
author = {Zhikai Lei and Tianyi Liang and Hanglei Hu and Jin Zhang and Yunhua Zhou and Yunfan Shao and Linyang Li and Chenchui Li and Changbo Wang and Hang Yan and Qipeng Guo},
journal= {arXiv preprint arXiv:2412.10056},
year = {2024}
}
备注
10 pages, 13 figures