探索人类- AI 概念对齐:以国际象棋为例
机器学习
2025-11-05 v2
摘要
AI 系统是否真正理解人类概念,或仅仅模拟表面模式?我们通过国际象棋来探索这一问题,其中人类创造力与精确战略概念相遇。分析一个达到大师级水平的 270 万参数变压器模型,我们发现了一个颇具讽刺意味的悖论:尽管前几层以最高可达 85% 的准确率编码了中心控制和车兵塔楼等人类概念,但更深层的层次尽管驱动着卓越的表现,却趋向异化表征,准确率降至 50-65%。为测试概念鲁棒性(超越记忆),我们引入首个国际象棋960数据集:240 个专家标注的局面,覆盖 6 个战略概念。当通过随机化起始位置消除开局理论后,所有方法的概念识别率下降 10-20%,揭示了该模型依赖记忆化模式而非抽象理解。我们的层级分析暴露了当前体系结构中的根本性张力:赢得比赛的表征与与人类思维对齐的表征存在差异。这表明随着 AI 系统针对性能不断优化,它们会发展出日益异化的智能,这是一项关键挑战,对于需要真正人类- AI 协作的创意 AI 应用而言尤为关键。数据集和代码均可在 https://github.com/slomasov/ChessConceptsLLM 提供。
关键词
引用
@article{arxiv.2510.26025,
title = {Exploring Human-AI Conceptual Alignment through the Prism of Chess},
author = {Semyon Lomasov and Judah Goldfeder and Mehmet Hamza Erol and Matthew So and Yao Yan and Addison Howard and Nathan Kutz and Ravid Shwartz Ziv},
journal= {arXiv preprint arXiv:2510.26025},
year = {2025}
}