泛化还是记忆?针对棋盘训练语言模型的鲁棒性测试
人工智能
2026-05-19 v1 计算与语言
摘要
近期研究对语言模型进行棋盘数据微调,报告高基准分数作为其能理解棋局规则、以专业水平完整棋局或以专家知识为依据的人类可读解释生成证据。我们训练了 KinGPT,这是一个仅在(位置、最佳走子)配对上训练的 25M 参数字符级语言模型,在 600 题 mate-in-N 测试套件和 4B 参数 C1-4B 20 主题谜题基准上均超越了 ChessGPT。我们检视了现有文献中关于棋盘训练语言模型的若干主张,断言其惊人的基准性能主要归因于模式匹配。我们还展示了如何通过 LLM-Modulo——一种嵌入式验证器框架——将 RedPajama 3B 在 mate-in-N 棋谜中的最佳走子准确率从 1.2% 提升至 21.2%,走子生成有效性从 19.3% 提升至 95.3%,相当于 ChessGPT 在棋盘特定网络语料上微调所实现的收益,却成本更低。我们的结果表明,将通用 LLM 与外部验证器配合,可为明确定义领域的合成数据直接训练提供更灵活的替代方案。我们开源了所有训练/评估代码、数据集、谜题样本以及 KinGPT 模型检查点,以便复现。
引用
@article{arxiv.2605.17565,
title = {Generalization or Memorization? Brittleness Testing for Chess-Trained Language Models},
author = {Ethan Tang},
journal= {arXiv preprint arXiv:2605.17565},
year = {2026}
}
备注
14 pages, 2 figures, 4 tables, 3 equations