中文

LLM-WikiRace 基准测试:大语言模型能否在真实知识图谱上进行规划

人工智能 2026-02-24 v3 机器学习

摘要

我们提出 LLM-Wikirace,用于评估大语言模型(LLM)中的规划、推理和世界知识能力。在 LLM-Wikirace 中,模型必须高效地逐步导航 Wikipedia 超链接,以从给定来源页面到达目标页面,这需要前瞻规划和推理真实世界概念连接的能力。我们评估了广泛的开源和闭源模型,包括 Gemini-3、GPT-5 和 Claude Opus 4.5,这些模型在任务的易难度层面取得最强结果并展现超人类表现。尽管如此,在硬难度层面上的表现仍显下降:最佳-performing 模型 Gemini-3 仅在 23% 的硬难度游戏中成功,凸显了面向前沿模型的仍存显著挑战。我们的分析表明,世界知识是成功的必要条件,但仅限于此阈值之上,规划和长期推理能力成为决定性因素。进一步的轨迹级分析揭示,即便是最强的模型在失败后仍难以重新规划,常陷入循环而非恢复。LLM-Wikirace 是一个简单基准测试,揭示了当前推理系统中的明确局限,为具备规划能力的 LLM 提供开放性场所,仍有大量需要验证的能力。我们的代码和排行榜已公开于 https:/llmwikirace.github.io。

关键词

引用

@article{arxiv.2602.16902,
  title  = {LLM-WikiRace Benchmark: How Far Can LLMs Plan over Real-World Knowledge Graphs?},
  author = {Juliusz Ziomek and William Bankes and Lorenz Wolf and Shyam Sundhar Ramesh and Xiaohang Tang and Ilija Bogunovic},
  journal= {arXiv preprint arXiv:2602.16902},
  year   = {2026}
}