中文

SKATE,一种可扩展的锦标赛评估:较弱的 LLM 通过可验证挑战区分更强的 LLM

人工智能 2026-02-13 v2

摘要

评估基础模型的能力和风险至关重要,然而当前方法需要大量的领域专业知识,这阻碍了它们在模型快速演进时的可扩展性。我们引入了 SKATE:一种新颖的评估框架,其中大语言模型(LLM)通过为彼此生成和解决可验证任务来竞争。我们的核心见解是将评估视为一场博弈:模型同时充当出题者和解题者,其动机是提出能突显自身优势并暴露他人弱点的问题。SKATE 提供了几个关键优势,平衡了可扩展性、开放性和客观性。它是完全自动化、无数据且可扩展的,无需人工输入或领域专业知识。通过使用可验证任务而非 LLM 裁判,评分是客观的。与领域受限的程序化生成基准(如下棋或空间推理)不同,让 LLM 创造性地提出挑战能够实现开放且可扩展的评估。作为概念验证,我们引入了 LLM 设置的代码输出预测(COP)挑战,作为一个可验证且可扩展的框架来测试我们的方法。使用基于 TrueSkill 的排名系统,我们评估了六个前沿 LLM,发现:(1)较弱的模型能够可靠地区分和评分更强的模型;(2)基于 LLM 的系统能够表现出自我偏好行为,生成与自身能力相匹配的问题;(3)SKATE 自动揭示了模型之间细粒度的能力差异。我们的发现是朝着能够跟上 LLM 进步步伐的通用、可扩展评估框架迈出的重要一步。

关键词

引用

@article{arxiv.2508.06111,
  title  = {SKATE, a Scalable Tournament Eval: Weaker LLMs differentiate between stronger ones using verifiable challenges},
  author = {Dewi S. W. Gould and Bruno Mlodozeniec and Samuel F. Brown},
  journal= {arXiv preprint arXiv:2508.06111},
  year   = {2026}
}

备注

7 pages and appendices