中文

ChessArena:评估大型语言模型战略推理能力的国际象棋测试平台

机器学习 2026-04-24 v4 人工智能

摘要

最近的大型语言模型(LLM)已展现出强大的推理能力。然而,一个关键问题仍然存在:这些模型是否具备真正的战略推理能力,还是主要擅长模式识别?为回答这一问题,我们提出了 ChessArena,一个基于国际象棋的 LLM 评估测试平台。国际象棋需要战略推理、精确的规则遵循以及追踪复杂游戏状态的能力。ChessArena 是一个竞争性框架,LLM 在四种对弈模式下相互对战。我们在 800 多场对弈中评估了 13 个 LLM,测试了基本理解、走子选择和谜题求解。结果揭示了显著的不足:没有模型能击败 Maia-1100(人类业余水平),有些甚至输给随机走子。我们还提出了一个强基线:我们微调的 Qwen3-8B 大幅提升了性能,接近更大的最先进推理模型。

关键词

引用

@article{arxiv.2509.24239,
  title  = {ChessArena: A Chess Testbed for Evaluating Strategic Reasoning Capabilities of Large Language Models},
  author = {Jincheng Liu and Sijun He and Jingjing Wu and Xiangsen Wang and Yang Chen and Zhaoqi Kuang and Siqi Bao and Yuan Yao},
  journal= {arXiv preprint arXiv:2509.24239},
  year   = {2026}
}