中文

排行榜幻象

人工智能 2025-05-13 v2 计算与语言 机器学习 统计方法学

摘要

衡量进展是推动任何科学领域发展的根本任务。随着基准测试在日益中心的作用,也越来越容易受到扭曲。Chatbot Arena 已成为排名最具能力 AI 系统的首选排行榜。然而,在本文中我们识别出导致该竞技场环境扭曲的系统性问题。我们发现未披露的私人测试做法惠及少数提供者,他们可在公开发布前测试多个变体并选择性地撤回分数。我们确立了这些提供者选择最佳分数的能力导致 Arena 分数偏斜,由于对绩效结果的选择性披露。在极端情况下,我们识别出 Meta 在 Llama-4 发布前测试了 27 个私人 LLM 变体。我们也确立了专有封闭模型被抽样率更高(战斗次数)且比开放权重和开源备选方案更少地被从竞技场中移除。这些政策导致数据访问不平衡。Google 和 OpenAI 分别获得了 Arena 数据总量的 19.2% 和 20.4%,而综合的 83 个开放权重模型仅获得总量的 29.7%。我们指出获取 Chatbot Arena 数据可获得显著益处;即使有限的额外数据也可在 Arena 分布上实现最高达 112% 的相对性能提升。这些动态共同导致对 Arena 特定动态的过拟合,而非对一般模型质量的提升。Arena 建立在组织者和开放社区的巨大努力基础上,后者维护着这一宝贵的评估平台。我们提供可操作的建议,以改革 Chatbot Arena 的评估框架,促进该领域更公平、更透明的基准测试。

关键词

引用

@article{arxiv.2504.20879,
  title  = {The Leaderboard Illusion},
  author = {Shivalika Singh and Yiyang Nan and Alex Wang and Daniel D'Souza and Sayash Kapoor and Ahmet Üstün and Sanmi Koyejo and Yuntian Deng and Shayne Longpre and Noah A. Smith and Beyza Ermis and Marzieh Fadaee and Sara Hooker},
  journal= {arXiv preprint arXiv:2504.20879},
  year   = {2025}
}

备注

68 pages, 18 figures, 9 tables