为何全局 LLM 排行榜具有误导性:面向异构监督机器学习的小型组合
机器学习
2026-05-08 v1 离散数学
新兴技术
最优化与控制
摘要
通过成对人类反馈对 LLM 进行排名,构成了当前面向创意写作和问题求解等开放式任务排行榜的基础。我们分析了来自 Arena 的 52 个 LLM 在 116 种语言中的约 89K 次比较,表明最佳拟合的全局 Bradley-Terry (BT) 排名具有误导性。近 2/3 的决定性选票相互抵消,甚至根据全局 BT 排名前 50 的模型在统计上也是不可区分的(前 50 名模型内的成对获胜概率最多为 0.53)。我们将这一失败追溯到跨语言、任务和时间的强烈且结构化的意见异构性。此外,我们发现一个重要特征——*语言*起着关键作用。按语言(及语系)分组极大地提高了选票的一致性,导致 ELO 分数的分布范围扩大了两个数量级(即非常一致的排名)。看似全局噪声的现象实际上是连贯但相互冲突的子群的混合。为了解决监督机器学习中的这种异构性,我们引入了 -组合框架,它们是预测误差最多为 且“覆盖”至少 比例用户的小型模型集合。我们将其表述为集合覆盖问题的一个变体,并利用底层集合系统的 VC 维度提供了保证。在 Arena 数据上,我们的算法仅恢复了 5 个不同的 BT 排名,在适度的 下覆盖了超过 96% 的选票,而全局排名的覆盖率仅为 21%。我们还提供了一个由 6 个 LLM 组成的组合,其覆盖的选票是全局排名中前 6 名 LLM 的两倍。我们进一步使用公平性正则化分类模型的集成,为 COMPAS 数据集上的一个分类问题构建了组合,并表明这些组合可用于检测数据中的盲点,这可能对政策制定者具有独立的意义。
引用
@article{arxiv.2605.06656,
title = {Why Global LLM Leaderboards Are Misleading: Small Portfolios for Heterogeneous Supervised ML},
author = {Jai Moondra and Ayela Chughtai and Bhargavi Lanka and Swati Gupta},
journal= {arXiv preprint arXiv:2605.06656},
year = {2026}
}