空货架还是失踪的钥匙?召回是参数化事实正确性的瓶颈
计算与语言
2026-02-17 v1 人工智能
摘要
标准的事实正确性评估将所有错误视为等价,从而掩盖了失败来源是缺乏知识(空货架)还是编码事实的访问受限(失踪的钥匙)。我们提出一种行为框架,通过事实层面而非问题层面来描绘事实知识, characterize 每个事实是否被编码,以及其可访问性:无法召回、可直接召回,或仅能通过推理时间计算(思考)来召回。为支持此类描绘,我们引入 WikiProfile,一个通过自动化管道构建的新基准,利用基于网页搜索的提示 LLM。我们收集了来自 13 个 LLM 的 400 万个回答,发现在我们的基准上,前沿模型的编码几乎已饱和,GPT-5 和 Gemini-3 的编码率达到 95--98%。然而,召回仍是一个主要瓶颈:许多此前归因于缺乏知识的错误实际上源于无法访问它们。这些失败是系统性的,尤其影响长尾事实和逆问题。最后,我们表明思考可以改善召回效果,并能恢复相当大比例的错误,表明未来的提升可能更多依赖于改进模型如何利用其已编码内容的方法,而非规模扩大。
引用
@article{arxiv.2602.14080,
title = {Empty Shelves or Lost Keys? Recall Is the Bottleneck for Parametric Factuality},
author = {Nitay Calderon and Eyal Ben-David and Zorik Gekhman and Eran Ofek and Gal Yona},
journal= {arXiv preprint arXiv:2602.14080},
year = {2026}
}