中文

使用语言模型跟踪世界状态:基于棋局的基于状态评估

人工智能 2025-08-28 v1

摘要

大型语言模型(LLM)在结构化领域展现出显现性能力,表明它们可能隐式内化了高保真度的世界模型表示。尽管探针技术在科学和基于游戏的环境中显示出积极迹象,但它们依赖于模型特定的内部激活,限制了可解释性和可泛化性。本文提出一种基于棋局的模型无关、基于状态的评估框架,用于评估LLM是否保留了结构化环境的语义。该方法分析下游合法移动分布(状态可行性),以估计预测游戏状态与实际游戏状态之间的语义保真度。该方法通过更贴近棋局战略和规则驱动性质的评估,优于常规基于字符串的指标。实验结果表明,我们的指标捕捉了状态跟踪中的不足,凸显了LLM在维持长序列中连贯内部模型方面的局限性。我们的框架为在不要求内部模型访问的情况下评估LLM的结构化推理提供了稳健工具,并可推广到广泛的符号环境。

关键词

引用

@article{arxiv.2508.19851,
  title  = {Tracking World States with Language Models: State-Based Evaluation Using Chess},
  author = {Romain Harang and Jason Naradowsky and Yaswitha Gujju and Yusuke Miyao},
  journal= {arXiv preprint arXiv:2508.19851},
  year   = {2025}
}

备注

Spotlight presentation at ICML 2025 Workshop on Assessing World Models