象棋-R1:通过强化学习提升大语言模型在中国象棋中的空间战略推理能力
人工智能
2025-11-19 v2
摘要
游戏玩法长期以来作为评估人工通用智能的基本基准。尽管大语言模型(LLM)在通用推理方面展现出惊人的能力,但其在空间战略推理方面的效果——这是复杂且完全可观测棋盘游戏中至关重要的能力——仍未得到充分探索。本文选取中国象棋作为具有挑战性和丰富测试基准,因其规则复杂且空间结构丰富。为提升大语言模型在此类环境中的战略能力,我们提出了针对中国象棋的训练框架,基于由五百万棋盘-棋子位置对组成的大规模数据集,增强了专家注释和引擎评估。基于此基础,我们引入象棋-R1,一个由七亿参数构成的模型,采用多阶段训练方式。我们的实验结果表明,尽管规模虽大且功能强大,通用型大语言模型在此类任务上难以达到令人满意的性能。相较于通用型大语言模型,象棋-R1在合法棋子位置提升了18个百分点,在分析准确率提升了22个百分点。我们的研究结果指向了在复杂领域创建通用战略智能的可行之路。
引用
@article{arxiv.2507.12215,
title = {Xiangqi-R1: Enhancing Spatial Strategic Reasoning in LLMs for Chinese Chess via Reinforcement Learning},
author = {Yuhao Chen and Shuochen Liu and Yuanjie Lyu and Chao Zhang and Jiayao Shi and Tong Xu},
journal= {arXiv preprint arXiv:2507.12215},
year = {2025}
}
备注
10 pages, 7 figures