使用语言模型跟踪世界状态:基于棋局的基于状态评估
人工智能
2025-08-28 v1
摘要
大型语言模型(LLM)在结构化领域展现出显现性能力,表明它们可能隐式内化了高保真度的世界模型表示。尽管探针技术在科学和基于游戏的环境中显示出积极迹象,但它们依赖于模型特定的内部激活,限制了可解释性和可泛化性。本文提出一种基于棋局的模型无关、基于状态的评估框架,用于评估LLM是否保留了结构化环境的语义。该方法分析下游合法移动分布(状态可行性),以估计预测游戏状态与实际游戏状态之间的语义保真度。该方法通过更贴近棋局战略和规则驱动性质的评估,优于常规基于字符串的指标。实验结果表明,我们的指标捕捉了状态跟踪中的不足,凸显了LLM在维持长序列中连贯内部模型方面的局限性。我们的框架为在不要求内部模型访问的情况下评估LLM的结构化推理提供了稳健工具,并可推广到广泛的符号环境。
引用
@article{arxiv.2508.19851,
title = {Tracking World States with Language Models: State-Based Evaluation Using Chess},
author = {Romain Harang and Jason Naradowsky and Yaswitha Gujju and Yusuke Miyao},
journal= {arXiv preprint arXiv:2508.19851},
year = {2025}
}
备注
Spotlight presentation at ICML 2025 Workshop on Assessing World Models