Open-LLM-Leaderboard:从多选题到开放式问题进行LLM评估、基准测试与竞技场
计算与语言
2024-06-12 v1 人工智能
摘要
多选题(MCQ)是评估大语言模型(LLM)常用的评估方法。通常情况下,给定一个问题后,LLM会选择最可能的答案,以考虑诸多因素,如长度。不幸的是,LLM可能固有地偏好某些答案选项ID,如A/B/C/D,due to先天的不平衡概率偏置,这会影响基于这些ID的答案预测。以往研究引入了方法来减少这种''selection bias'',通过简单地对少数几个测试样本置换选项并应用到新样本。另一个MCQ问题是''random guessing''的幸运选择问题。LLM并不学习特定知识,但选项被正确猜中。这一情况尤其严重于小规模LLM。为解决这些问题,一种更彻底的方法是从MCQ转向开放式问题,这可以根本消除selection bias和random guessing问题。然而,转换本身也带来了一系列挑战:(1) 识别合适的开放式问题,(2) 验证LLM开放式回应的正确性与人工标注的ground-truths。本工作旨在解决这些重要困难,建立一个通过完全开放式问题的新LLM评估基准。因此,我们引入Open-LLM-Leaderboard来跟踪各种LLM的性能并反映它们的真实能力,如GPT-4o/4/3.5、Claude 3、Gemini等.我们的代码和数据集可在https://github.com/VILA-Lab/Open-LLM-Leaderboard获取。
引用
@article{arxiv.2406.07545,
title = {Open-LLM-Leaderboard: From Multi-choice to Open-style Questions for LLMs Evaluation, Benchmark, and Arena},
author = {Aidar Myrzakhan and Sondos Mahmoud Bsharat and Zhiqiang Shen},
journal= {arXiv preprint arXiv:2406.07545},
year = {2024}
}
备注
Code and dataset are available at https://github.com/VILA-Lab/Open-LLM-Leaderboard