中文

状态设计决定性:大型语言模型中表征如何塑造动态推理

计算与语言 2026-02-19 v1 人工智能

摘要

随着大型语言模型(LLM)从静态推理任务迈向动态环境,其成功取决于能够在推理时与不断变化的环境进行导航和响应。这些场景下的表征方式是一个较少探讨的关键因素。本文在保持模型参数不变的前提下,系统性地变更三个关键方面:(1)状态粒度(长形式与概要),(2)结构(自然语言与符号),(3)空间 grounding(文本唯一与图像或文本地图编码),并在顺序决策基准中进行测试。我们发现,轨迹概要化通过降低噪声和稳定长程推理而提升性能。其次,自然语言表征在不同模型之间最为稳健,而结构化编码主要对那些具有强代码或结构化输出先验(如 JSON 模式)的模型有所帮助。再者,虽然图像输入显示出一定的益处,但基于文本的空间编码最为有效。这种优势并非源于空间信息本身,而是源于构建行为本身促使模型执行静态输入未能激发的空间推理。总体而言,我们证明了表示状态的设计选择是性能决定性因素,这与信息本身的可用性不同。然而,即便在改进的表征下,当前的 LLM 和 VLM 在长程推理中仍显脆弱,尤其是在需要综合信息以管理多个子任务以达成目标时。

关键词

引用

@article{arxiv.2602.15858,
  title  = {State Design Matters: How Representations Shape Dynamic Reasoning in Large Language Models},
  author = {Annie Wong and Aske Plaat and Thomas Bäck and Niki van Stein and Anna V. Kononova},
  journal= {arXiv preprint arXiv:2602.15858},
  year   = {2026}
}