SEAL:通过 LLM 作为元评判家是否可以唤醒饱和基准
计算与语言
2026-05-29 v1
摘要
广泛使用的语言模型基准正在变得饱和,前沿系统常获得接近一致的分数,标准指标无法解决。我们询问是否可以通过改进对相同候选输出的评估来使现有任务重新变得有信息。因此,我们提出了 Seeded Elimination with Adaptive LLM-as-a-Meta-Judge (SEAL),这是一种从饱和基准中提取潜在排序信号的自我改进评估协议。SEAL 将候选输出种入单个消除器中,并根据任务级原则加上自我改进清单准则对每场匹配进行评估。我们在覆盖代码生成、数学推理、知识密集型问答和工具使用智能体任务完成的多个饱和基准上评估了 SEAL。在这些设置下,SEAL 在排序准确率-延迟权衡上优于竞争协议,达到了 0.83--1.00 的斯佩曼一致性与完整成对评判,4/4 的 Top-1 一致性,仅需 11.89 次调用每个任务,相较于完整成对评估的 28.00 次。
引用
@article{arxiv.2605.30104,
title = {SEAL: Can Saturated Benchmarks Be Revived by LLM-as-a-Meta-Judge?},
author = {Jiamin Chen and Yidi Wu and Qiexiang Wang and Qianben Chen and Yuchen Li and Yansen Zhang and Xiaokun Zhang and Wangchunshu Zhou and Chen Ma},
journal= {arXiv preprint arXiv:2605.30104},
year = {2026}
}