中文

超越准确性:大型语言模型在象棋评估中的几何稳定性分析

人工智能 2025-12-18 v1

摘要

在复杂推理领域中,对大型语言模型(LLM)的评估通常依赖于与真实答案的性能对齐。在象棋领域,这种标准表现为对强大引擎如 Stockfish 的准确性基准测试。然而,高的标量准确性并不一定意味着稳健的概念性理解。本文认为,标准的准确性指标无法区分真正的几何推理与对规范棋盘状态的浅层记忆。为弥合这一差距,我们提出了几何稳定性框架,这是一种新颖的评估方法,通过严格测试在不变变换下的模型一致性,包括板块旋转、镜像对称、颜色反转和格式转换。我们将该框架应用于对六个最先进大型语言模型(包括 GPT-5.1、Claude Sonnet 4.5 和 Kimi K2 Turbo)的比较分析,采用约 3000 个棋局位置的数据集。我们的结果揭示了显著的准确性-稳定性悖论。虽然诸如 GPT-5.1 的模型在标准位置上几乎达到最佳准确性,但在几何扰动下表现出灾难性退化,具体是在旋转任务中,错误率激增超过 600%。这种差异表明模型依赖于模式匹配而非抽象空间逻辑。相比之下,Claude Sonnet 4.5 和 Kimi K2 Turbo 表现出优越的双重稳健性,在所有变换轴上都保持高水平的一致性。此外,我们分析了有帮助性与安全性之间的权衡,确定 Gemini 2.5 Flash 在非法状态拒绝方面为首位(达 96.0%)。我们得出结论,几何稳定性提供了一种正交且必不可少的评估指标,为解决构象推理能力与大规模模型数据污染和过拟合之间的关系提供了必要的代理指标。

关键词

引用

@article{arxiv.2512.15033,
  title  = {Beyond Accuracy: A Geometric Stability Analysis of Large Language Models in Chess Evaluation},
  author = {Xidan Song and Weiqi Wang and Ruifeng Cao and Qingya Hu},
  journal= {arXiv preprint arXiv:2512.15033},
  year   = {2025}
}