中文

LLMpedia:面向LLM知识体系化的透明框架

计算与语言 2026-03-26 v1 数据库

摘要

诸如MMLU等基准测试表明,旗舰语言模型正在接近事实准确性饱和点,得分超过90%。我们指出,这一图景并不完整。LLMpedia完全基于参数记忆生成百科全书式文章,覆盖三种模型家族,生成约100万篇文章,无需检索。对于gpt-5-mini,其在覆盖维基百科主题的可验证真实率仅为74.7%——比基准测试给出的图景低出超过15个百分点,这与固定问题评估的可得偏差相一致。除维基百科之外,面向前沿主题的可验证内容(仅通过精选网络证据可查)进一步下降到63.2%的真实率。维基百科仅覆盖61%的曝光主题,三种模型家族在主题选择方面的重叠仅为7.3%。在类似Grokipedia的捕获陷阱基准测试中,LLMpedia在可验证事实正确性方面显著高于维基百科,同时文本相似度仅为其的一半。不同于Grokipedia的是,LLMpedia公开了每个提示、制品和评估判断,成为第一个完全开放的参数化百科全书——桥接事实评估与知识物化。所有数据、代码以及可浏览界面均已公开:https://llmpedia.net。

关键词

引用

@article{arxiv.2603.24080,
  title  = {LLMpedia: A Transparent Framework to Materialize an LLM's Encyclopedic Knowledge at Scale},
  author = {Muhammed Saeed and Simon Razniewski},
  journal= {arXiv preprint arXiv:2603.24080},
  year   = {2026}
}