重新思考面向语义理解的大语言模型生成式评估
计算与语言
2024-03-13 v1
摘要
尽管大型语言模型(LLMs)能力复杂,但其有效评估面临重大障碍。本文首先重新审视了主流的评估方法——多项选择题回答(MCQA),该方法允许直接测量准确率。通过对 24 个模型在 11 个基准上的全面评估,我们强调了 MCQA 的几个潜在缺陷,例如,MCQA 评估与实际场景中开放式回答生成之间的不一致性。为此,我们引入了一个 RWQ-Elo 评级系统,让 24 个 LLM(如 GPT-4、GPT-3.5、Google-Gemini-Pro 和 LLaMA-1/-2)以双玩家竞赛形式参与,并由 GPT-4 担任裁判。每个 LLM 随后获得一个 Elo 评级。该系统旨在反映真实世界使用情况,为此,我们编制了一个名为“真实世界问题”(RWQ)的新基准,包含 20,772 个真实的用户查询。此外,我们深入分析了我们系统的特性,并将其与 AlpacaEval 和 MT-Bench 等先前的排行榜进行了比较。我们的分析揭示了 RWQ-Elo 系统的稳定性、注册新模型的可行性,以及其重塑 LLM 排行榜的潜力。
引用
@article{arxiv.2403.07872,
title = {Rethinking Generative Large Language Model Evaluation for Semantic Comprehension},
author = {Fangyun Wei and Xi Chen and Lin Luo},
journal= {arXiv preprint arXiv:2403.07872},
year = {2024}
}