当基准成为目标:揭示大语言模型排行榜的敏感性
计算与语言
2024-07-04 v2 人工智能
机器学习
摘要
基于基准排名的大语言模型(LLM)排行榜经常被用来指导从业者进行模型选择。通常,已发布的排行榜排名被当作事实——我们表明这是一个(可能代价高昂的)错误。在现有排行榜下,LLM的相对性能对(通常微小的)细节高度敏感。我们表明,对于流行的多项选择题基准(例如MMLU),对基准的微小扰动,例如改变选项顺序或答案选择方法,会导致排名变化多达8位。我们通过对三类基准扰动进行系统实验并识别这种行为的原因来解释这一现象。我们的分析得出了若干最佳实践建议,包括混合评分方法在答案选择中的优势。我们的研究强调了依赖简单基准评估的危险性,并为在现有基准上建立更稳健的评估方案指明了道路。本文代码可在https://github.com/National-Center-for-AI-Saudi-Arabia/lm-evaluation-harness获取。
引用
@article{arxiv.2402.01781,
title = {When Benchmarks are Targets: Revealing the Sensitivity of Large Language Model Leaderboards},
author = {Norah Alzahrani and Hisham Abdullah Alyahya and Yazeed Alnumay and Sultan Alrashed and Shaykhah Alsubaie and Yusef Almushaykeh and Faisal Mirza and Nouf Alotaibi and Nora Altwairesh and Areeb Alowisheq and M Saiful Bari and Haidar Khan},
journal= {arXiv preprint arXiv:2402.01781},
year = {2024}
}
备注
updated with ACL 2024 camera ready version