中文

Project MPG:迈向一个面向LLM能力的通用性能基准

软件工程 2024-10-31 v1 人工智能

摘要

存在极其广泛的LLM基准测试任务,而通常一个单一数字对于决策制定(尤其是非专家)是最具可操作性的。目前不存在不基于Elo的聚合模式,而基于Elo可能成本高昂或耗时。在此,我们提出了一种在通用基准空间上聚合性能的方法,绰号“MPG”项目,全称“模型性能与优良度”,同时也引用了一个被广泛理解、虽重要但不精确且粗略的汽车性能度量指标。在此,我们创建了两个数字:一个“优良度”数字(答案准确率)和一个“快速度”数字(成本或每秒查询数QPS)。我们将模型相互比较,并根据我们的通用指标及子领域呈现排名。我们发现我们的分数与Chatbot Arena的原始皮尔逊相关系数之间存在显著一致性,甚至优于MMLU排行榜与Chatbot Arena的相关性。

关键词

引用

@article{arxiv.2410.22368,
  title  = {Project MPG: towards a generalized performance benchmark for LLM capabilities},
  author = {Lucas Spangher and Tianle Li and William F. Arnold and Nick Masiewicki and Xerxes Dotiwalla and Rama Parusmathi and Peter Grabowski and Eugene Ie and Dan Gruhl},
  journal= {arXiv preprint arXiv:2410.22368},
  year   = {2024}
}