LLM 的 IQ 测试:揭示 LLM 核心技能的评估框架
宇宙学与河外天体物理
2025-07-29 v1 高能天体物理现象
高能物理 - 唯象学
摘要
当前对大语言模型 (LLM) 的评估依赖基准得分,但难以解释这些单个得分揭示了模型整体技能的哪些方面。具体而言,我们作为社区缺乏对任务之间关系、它们共同测度什么、它们如何不同以及哪些是冗余的理解。因此,对模型通常进行单一得分的平均评估,这种方法未能捕捉模型的整体优势与局限。本文提出一种新范式,通过因子分析识别驱动基准表现的潜在技能。我们将此方法应用于展示 60 个 LLM 在 44 个任务上表现的全面新型排行榜,并识别出一小组潜在技能基本解释了表现。最后,我们将这些见解转化为实用工具,以识别冗余任务、辅助模型选择,并沿每个潜在技能轮廓模型。
引用
@article{arxiv.2507.20207,
title = {Directional Neutrino Bursts from Spinning and Moving Primordial Black Holes},
author = {Arnab Chaudhuri and Priya Mishra and Rukmani Mohanta},
journal= {arXiv preprint arXiv:2507.20207},
year = {2025}
}
备注
5 pages, 8 figures. Supplemental Material (4 pages, 1 figure) included