Project MPG:迈向一个面向LLM能力的通用性能基准
软件工程
2024-10-31 v1 人工智能
摘要
存在极其广泛的LLM基准测试任务,而通常一个单一数字对于决策制定(尤其是非专家)是最具可操作性的。目前不存在不基于Elo的聚合模式,而基于Elo可能成本高昂或耗时。在此,我们提出了一种在通用基准空间上聚合性能的方法,绰号“MPG”项目,全称“模型性能与优良度”,同时也引用了一个被广泛理解、虽重要但不精确且粗略的汽车性能度量指标。在此,我们创建了两个数字:一个“优良度”数字(答案准确率)和一个“快速度”数字(成本或每秒查询数QPS)。我们将模型相互比较,并根据我们的通用指标及子领域呈现排名。我们发现我们的分数与Chatbot Arena的原始皮尔逊相关系数之间存在显著一致性,甚至优于MMLU排行榜与Chatbot Arena的相关性。
引用
@article{arxiv.2410.22368,
title = {Project MPG: towards a generalized performance benchmark for LLM capabilities},
author = {Lucas Spangher and Tianle Li and William F. Arnold and Nick Masiewicki and Xerxes Dotiwalla and Rama Parusmathi and Peter Grabowski and Eugene Ie and Dan Gruhl},
journal= {arXiv preprint arXiv:2410.22368},
year = {2024}
}