超越提问:评估大型语言模型(实际)知道什么
计算与语言
2026-05-27 v1 人工智能
摘要
大型语言模型(LLM)中的参数化知识是其成功的基石,但人们对它的理解仍然不足。现有的知识基准通常依赖于预定义的问题(例如,“马丁·路德·金的出生日期是什么?”),仅评估基准设计者明确选择查询的知识,这是一种有问题的可用性偏差。在本文中,我们引入了开放知识评估,这是一种用于LLM知识基准测试的新范式。它不是提出狭隘的问题,而是评估模型在响应开放式启发提示(例如,“告诉我你所知道的关于马丁·路德·金的一切”)时选择呈现的知识。这将焦点从预定义的答案检索转向表征模型自然表达的知识。我们通过BeQu(超越提问)实例化了这一范式,这是一个包含10,000个实体并配以用于陈述验证的参考语料库的基准。利用BeQu,我们评估了广泛的语言模型,并分析了推理努力、模型规模、提示格式和知识领域的影响。数据和排行榜可在本工作的GitHub仓库和基准测试网站上获取。
引用
@article{arxiv.2605.26937,
title = {Beyond Questions: Evaluating What Large Language Models (Actually) Know},
author = {Luca Giordano and Simon Razniewski},
journal= {arXiv preprint arXiv:2605.26937},
year = {2026}
}