中文

记号游戏:基于拼图对决评估语言模型推理能力

人工智能 2026-05-19 v2

摘要

评估大语言模型的推理能力日益具有挑战性。人类精心策划的困难问题成本极高,尤其是最近使用博士级领域知识挑战最强大模型的基准测试。即便如此,也始终担心这些问题是否测试真正的推理,或是类似问题是否在训练期间被见过。本文借鉴16世纪数学对决的思想,设计记号游戏(TTG):模型之间通过创建自己的谜题来相互挑战。我们利用编程谜题的格式——给定一个返回布尔值的函数,寻找使其返回True的输入——来灵活表示问题,使解答可验证。通过两两对决的结果,我们计算Elo评级,从而相对于彼此比较模型。我们在TTG上评估了10个前沿模型, closely match来自Humanity's Last Exam等现有基准测试的排名,花费不足200美元,无需任何人类参与创建谜题。我们也发现,对于当前模型而言,创建优质谜题仍是高度具挑战性的任务。总体而言,我们的工作建议新的评估范式,旨在设计上避免饱和,同时允许测试模型诸如创造力和任务创建等技能,除了问题解决能力。

关键词

引用

@article{arxiv.2602.17831,
  title  = {The Token Games: Evaluating Language Model Reasoning with Puzzle Duels},
  author = {Simon Henniger and Gabriel Poesia},
  journal= {arXiv preprint arXiv:2602.17831},
  year   = {2026}
}

备注

Project website: https://token-games.ai/