中文

LLM 瑞士轮:通过竞争性瑞士制动态聚合多基准性能

机器学习 2025-12-25 v1 人工智能 性能

摘要

大型语言模型(LLM)的迅速增长和多样化的专业基准要求从碎片化的、特定任务的指标转向一个整体的、竞争性的排名系统,该系统能有效聚合跨多个能力维度的性能。当前主要使用静态评分的评估方法存在根本性局限。它们难以确定不同基准之间的适当混合比例,而且关键的是,它们无法捕捉模型的动态竞争适应性或其在面对连续高风险任务时的脆弱性。为解决这一问题,我们引入了新颖的竞争性瑞士制动态(CSD)框架。CSD 模拟了一场多轮、连续的竞赛,模型根据其累积的胜负记录,在一系列精心策划的基准序列中被动态配对。并使用蒙特卡洛模拟(N=100,000N=100,000 次迭代)来近似统计上稳健的期望胜分(E[Sm]E[S_m]),这消除了随机配对和早期轮次运气的噪声。此外,我们通过参数化每轮淘汰数量(TkT_k)实施了失效敏感性分析,这使我们能够根据模型的风险偏好对其进行画像——区分稳健的通才和激进的专才。我们证明,与传统的聚合评分和静态成对模型相比,CSD 提供了更细致且具有上下文感知的排名,这代表了迈向风险知情的新一代 LLM 评估的关键一步。

关键词

引用

@article{arxiv.2512.21010,
  title  = {LLM Swiss Round: Aggregating Multi-Benchmark Performance via Competitive Swiss-System Dynamics},
  author = {Jiashuo Liu and Jiayun Wu and Chunjie Wu and Jingkai Liu and Zaiyuan Wang and Huan Zhou and Wenhao Huang and Hongseok Namkoong},
  journal= {arXiv preprint arXiv:2512.21010},
  year   = {2025}
}

备注

18 pages