中文

TTT-Bench:通过简单新颖井字棋风格游戏评估推理能力的基准

计算与语言 2025-06-13 v1 人工智能

摘要

大型推理模型(LRMs)在广泛的任务中展现了令人印象深刻的推理能力,包括国际数学奥林匹克级别的数学问题,表明其具有复杂推理能力的证据。尽管许多推理基准聚焦于 STEM 领域,但 LRMs 在更广泛任务领域中的正确推理能力仍未得到充分探索。在本工作中,我们引入了 TTT-Bench,一个新的基准,旨在通过一套四个两人井字棋风格游戏来评估 LRMs 的基本战略、空间和逻辑推理能力,这些游戏人类从幼年起即可轻松解决。我们提出了一种简单且可扩展的程序化方法,用于为 TTT-Bench 生成可验证的两人游戏问题。尽管这些游戏对人类来说微不足道,但它们需要推理对手的意图以及游戏棋盘的空间配置,以确保获胜。我们评估了一组多样化的大型推理模型,发现擅长解决高难度数学问题的模型在这些简单的推理游戏中经常失败。进一步的测试表明,与 MATH 500 和 AIME 2024 相比,我们评估的推理模型在 TTT-Bench 上的平均得分分别低 41% 和 5%,更大的模型使用更短的推理轨迹获得更高性能,其中大多数模型在简单和新的 TTT-Bench 任务上的长期战略推理情境中表现困难。

关键词

引用

@article{arxiv.2506.10209,
  title  = {TTT-Bench: A Benchmark for Evaluating Reasoning Ability with Simple and Novel Tic-Tac-Toe-style Games},
  author = {Prakamya Mishra and Jiang Liu and Jialian Wu and Xiaodong Yu and Zicheng Liu and Emad Barsoum},
  journal= {arXiv preprint arXiv:2506.10209},
  year   = {2025}
}