中文

Watson & Holmes:衡量人类与大语言模型推理能力的自然化基准

人工智能 2026-02-24 v1

摘要

现有的 AI 推理基准对这些能力是否类似于人类在自然化情境下的推理能力几乎没有提供有关信息。我们将 Watson & Holmes 侦探桌上游戏的一种改编版作为新的基准,用于使用逐步呈现的叙事证据、开放式问题和不受约束的语言响应来评估推理性能。开发了用于自动评分的评估系统,并通过人类评估者验证,以实现可扩展且可复制的绩效评估。结果表明,AI 模型的绩效随着时间的推移出现明显提升。2025 年九个月间,模型绩效从人类比较组的下四分位数提升至约前 5%。约有半数的提升反映了连续模型版本发布所带来的进步,另一半则对应于与推理导向模型架构相关的显著步骤性变化。除非解决较长案件 (案例长度在 1900-4000 字之间) 时模型性能下降,以及在证据稀缺时模型在归纳推理方面优于人类的外观外,系统上述 AI 模型与人类的绩效差异大多数情况下并不存在。

关键词

引用

@article{arxiv.2602.19914,
  title  = {Watson & Holmes: A Naturalistic Benchmark for Comparing Human and LLM Reasoning},
  author = {Thatchawin Leelawat and Lewis D Griffin},
  journal= {arXiv preprint arXiv:2602.19914},
  year   = {2026}
}

备注

51 pages, 13 figures