中文

SimpleQA Verified:用于衡量参数化知识可靠性的事实性基准

计算与语言 2026-03-11 v2

摘要

我们引入 SimpleQA Verified,这是一个包含 1000 个提示的基准,用于评估大语言模型(LLM)的短形式事实性,基于 OpenAI 的 SimpleQA。它解决了 OpenAI 基准中的关键局限性,包括噪声和错误标签、主题偏见以及问题冗余。SimpleQA Verified 通过严格的多阶段筛选过程实现,包括去重、主题平衡和来源校正,以产生更可靠、更具挑战性的评估集,并改进了自助评估提示器。在新基准上,Gemini 2.5 Pro 实现了 55.6 的最高 F1 分数,超越了其他前沿模型,包括 GPT-5。这项工作为研究社区提供了一个更高保真度的工具,用于跟踪参数化模型事实性的真实进展,并缓解幻觉问题。基准数据集、评估代码和排行榜已可用于:https://www.kaggle.com/benchmarks/deepmind/simpleqa-verified。

关键词

引用

@article{arxiv.2509.07968,
  title  = {SimpleQA Verified: A Reliable Factuality Benchmark to Measure Parametric Knowledge},
  author = {Lukas Haas and Gal Yona and Giovanni D'Antonio and Sasha Goldshtein and Dipanjan Das},
  journal= {arXiv preprint arXiv:2509.07968},
  year   = {2026}
}