中文

探索大语言模型的状态跟踪能力

计算与语言 2025-11-14 v1

摘要

大语言模型 (LLM) 已在解决需要一定推理能力的复杂任务方面展现出惊人的能力。本文聚焦于状态跟踪问题,即模型需要跟踪控制多个实体的状态。为隔离状态跟踪组件以免受其他因素影响,本文提出了一个基于三个明确定义的状态跟踪任务的数据基准,并分析了 LLM 在不同情景下的表现。结果表明,最新一代 LLM(特别是 GPT-4 和 Llama3)能够进行状态跟踪,尤其是在集成诸如链式思考等机制时。然而,来自前一代的模型虽然能够理解任务并在初始阶段解决问题,但在经过一定步骤后常常会失败。

关键词

引用

@article{arxiv.2511.10457,
  title  = {Exploring State Tracking Capabilities of Large Language Models},
  author = {Kiamehr Rezaee and Jose Camacho-Collados and Mohammad Taher Pilehvar},
  journal= {arXiv preprint arXiv:2511.10457},
  year   = {2025}
}