ReLE:诊断中国语言大模型能力异质性的可扩展系统与结构化基准
计算机视觉与模式识别
2026-01-27 v1 人工智能
摘要
大语言模型(LLM)在中文语言理解方面取得了快速进展,但准确评估其能力仍面临基准饱和和计算成本高昂的挑战。虽然静态排行榜提供了快照式排名,却常常掩盖了能力之间结构性权衡。在本工作中,我们提出ReLE(Robust Efficient Live Evaluation),一个旨在诊断能力异质性(即模型在不同领域性能上的非均匀性)的可扩展系统。通过ReLE,我们评估了304个模型(其中189个商业模型,115个开源模型),其跨越由207,843个样本构成的领域×能力正交矩阵。我们引入两种方法性贡献以解决当前评估中的瓶颈:(1)基于符号的混合评分机制消除了推理任务中的嵌入式误报;(2)基于带噪声校正的Neyman分配的动态方差感知调度器,使计算成本相较于完整遍历评估降低70%,同时保持排名相关系数达到ρ=0.96。我们的分析表明,聚合排名对权重方案高度敏感:模型在ReLE中的排名稳定�幅(RSA)为11.4,而传统基准中约为5.0,这确认了现代模型高度专业化而非普遍优越。我们将ReLE定位为不取代全面静态基准的工具,而是模型生态演化的高频诊断监控器。
引用
@article{arxiv.2601.17399,
title = {ReLE: A Scalable System and Structured Benchmark for Diagnosing Capability Anisotropy in Chinese LLMs},
author = {Rui Fang and Jian Li and Wei Chen and Bin Hu and Ying-Cong Chen and Xin Tang and Liang Diao},
journal= {arXiv preprint arXiv:2601.17399},
year = {2026}
}