评估未见能力:LLM 知道多少定理?
计算与语言
2025-06-04 v1 信息检索
机器学习
应用统计
统计方法学
摘要
对大型语言模型(LLM)的准确评估对于理解其能力并指导其发展至关重要。然而,当前的评估往往不一致地反映这些模型的实际能力。在本文中,我们证明导致这种“评估危机”的众多因素之一是对未见知识的忽视——即由 LLM 编码但在评估期间未被直接观察到或尚未观察到的信息。我们引入了 KnowSum,这是一个统计框架,旨在通过量化一类评估任务中的未见知识来提供更全面的评估。KnowSum 通过对已观察知识实例的出现频率进行外推来估计未观察到的部分。我们在三个关键应用中展示了 KnowSum 的有效性与实用性:估计总知识量、评估信息检索有效性以及衡量输出多样性。我们的实验表明,仅依赖观察到的 LLM 性时会遗漏大量知识。重要的是,KnowSum 基于若干常见 LLM 的内部知识产生了显著不同的比较排名。
引用
@article{arxiv.2506.02058,
title = {Evaluating the Unseen Capabilities: How Many Theorems Do LLMs Know?},
author = {Xiang Li and Jiayi Xin and Qi Long and Weijie J. Su},
journal= {arXiv preprint arXiv:2506.02058},
year = {2025}
}