ChessQA:评估大型语言模型棋类理解的基准
机器学习
2025-10-29 v1 人工智能
摘要
棋类为评估大型语言模型 (LLM) 的推理、建模和抽象能力提供了理想的测试环境,因其具有明确的结构和客观的真实答案,同时涵盖了广泛的技能水平。然而,现有的 LLM 棋类能力评估往往非系统且范围狭窄,难以准确衡量 LLM 的棋类理解水平及其随规模、后训练方法或架构选择的变化。我们提出 ChessQA,一个综合性基准,用于评估 LLM 棋类理解,涵盖五个任务类别(结构、图案、短战术、位置判断和语义),大致对应于玩家在积累棋类知识后掌握的逐级抽象,从理解基本规则和学习战术图案到正确计算战术、评估局势和语义描述高层次概念。通过这种方式,ChessQA 能更全面地描绘棋类能力和理解,显著超越以往仅评估棋步质量的简单评估,提供受控、一致的诊断和比较环境。此外,ChessQA 本质上是动态的,包含可随模型改进而演化的提示、答案密钥和构建脚本。我们评估了广泛的当代 LLM,发现各任务类别均存在持续性弱点,并提供了按类别的评估结果和错误分析。我们将发布代码、定期更新的数据集以及公开排行榜,以支持进一步研究。
引用
@article{arxiv.2510.23948,
title = {ChessQA: Evaluating Large Language Models for Chess Understanding},
author = {Qianfeng Wen and Zhenwei Tang and Ashton Anderson},
journal= {arXiv preprint arXiv:2510.23948},
year = {2025}
}
备注
33 pages,8 figures