SCAN:结构化能力评估与语言模型导航
计算与语言
2026-05-04 v4
摘要
对大型语言模型(LLM)的评估越来越受到重视,自动评估基准正逐渐成为人类评估的替代方案。虽然现有研究侧重于逼近模型排名,但这些基准未能为用户和开发者提供对特定模型能力的全面且细粒度的理解。为填补这一差距,我们提出了SCAN(Structured Capability Assessment and Navigation),一个实用的框架,使其能够通过全面且细粒度的评估对语言模型的能力进行详细特征化。SCAN 包含四个关键组件:(1)TaxBuilder,从大量查询中提取能力指示标签,自动构建层次化分类学;(2)RealMix,查询合成与过滤机制,确保每个能力标签都有充足的评估数据;(3)一套可视化和分析工具,便于高效导航和分析模型能力;(4)基于PC(Pre-Comparison-derived Criteria)的LLM-as-a-Judge方法,相较于经典LLM-as-a-Judge方法,准确率显著提高。在使用SCAN对21个主流语言模型进行全面评估后,我们对GPT-OSS系列的详细分析显示,即使在同一能力类别的子能力中,也存在显著的性能差异。这一发现凸显了在准确理解语言模型行为方面,细粒度评估的重要性。项目主页和资源可在\href{https://github.com/liudan193/SCAN}{https://github.com/liudan193/SCAN}获取。
引用
@article{arxiv.2505.06698,
title = {SCAN: Structured Capability Assessment and Navigation for LLMs},
author = {Zongqi Wang and Tianle Gu and Chen Gong and Xin Tian and Siqi Bao and Yujiu Yang},
journal= {arXiv preprint arXiv:2505.06698},
year = {2026}
}
备注
Accepted by ACL 2026 Main