大语言模型内部推理的时空隐藏状态动力学特征
计算与语言
2026-05-05 v1 人工智能
摘要
大规模推理模型 (LRMs) 生成扩展解答,但仍不清楚这些轨迹反映的是实质性内部计算,还是仅是冗余和过度思考。尽管最近的隐藏状态分析表明内部表示携带正确性相关信号,但其粗糟的聚合可能掩盖推理计算所基于的标记和层结构。我们研究解码步骤和层之间的隐藏状态转换,识别出 LRMs 具备独特时空模式:成功轨迹表现为广泛的时间动力学与局部的层级集中,而该结构在非推理模型和知识密集型领域中较弱。我们将这一特征formalized为隐藏状态振幅 (StALT),这是一种总结相邻标记之间时间变化的统计量,权重为标记内部层显著性。跨 diverse models 和 benchmarks,StALT 可靠地分离正确与错误轨迹于推理密集型情境中,提供了与强输出空间和长度基准相当的无标签正确性信号。干预分析进一步表明,这种时空振幅对增加或减少内部推理需求的操纵具有系统性响应,支持其与 LRMs 隐藏状态动力学相关。这些发现提供了 LRMs 具备可测量隐藏状态动力学的实证证据,并提供一种实用探针,用于理解超出基于输出的评估的内部计算。
引用
@article{arxiv.2605.01853,
title = {Spatiotemporal Hidden-State Dynamics as a Signature of Internal Reasoning in Large Language Models},
author = {Kotaro Furuya and Takahito Tanimura},
journal= {arXiv preprint arXiv:2605.01853},
year = {2026}
}