中文

PRISM:通过语义流和潜在计算双视图审视LLM推理

计算与语言 2026-03-25 v1

摘要

大型语言模型(LLM)通过生成多步骤推理痕迹来解决复杂问题。然而,这些痕迹通常仅从两种视角之一进行分析:来自生成文本中不同推理步骤之间令牌序列,或来自单个步骤内模型层之间隐藏状态向量。我们介绍PRISM(通过语义和隐式建模进行概率推理检查),这是一种框架和诊断工具,用于同时分析这两个水平,提供推理如何在步骤和层之间演化的统一视图。通过对多种推理模型和基准测试的评估,PRISM揭示了推理过程中系统性模式,表明失败的轨迹更容易陷入无产品验证循环中,并进一步发展为过度思考和过早承诺等不同模式,这些模式在达到候选答案后行为不同。它进一步揭示了提示如何通过改变语义转换和内部计算模式来重塑推理行为,而不仅仅是通过整体准确率。通过将推理轨迹建模为结构化过程,PRISM将这些行为变得可观测和可分析,而不仅仅是依赖最终任务准确性。综上所述,这些见解将PRISM定位为分析和诊断LLM推理过程的实用工具。

关键词

引用

@article{arxiv.2603.22754,
  title  = {PRISM: A Dual View of LLM Reasoning through Semantic Flow and Latent Computation},
  author = {Ruidi Chang and Jiawei Zhou and Hanjie Chen},
  journal= {arXiv preprint arXiv:2603.22754},
  year   = {2026}
}