中文

真理即轨迹:揭示大语言模型推理的内部表征

计算与语言 2026-03-03 v1 机器学习

摘要

现有的大语言模型(LLM)解释方法通常将隐藏状态视为激活空间中的静态点,假设正确推理与错误推理可通过单层表示进行分离。然而,这些激活被多义特征饱和,导致线性探针学习表层词汇模式,而非底层推理结构。我们提出“真理即轨迹”(Truth as a Trajectory,TaT),将Transformer推理建模为迭代细化的展开轨迹,分析从静态激活转向层级几何位移。通过分析跨层级表示的位移,TaT揭示了区分有效推理与虚构行为的几何不变量。我们在密集架构和混合专家(Mixture-of-Experts,MoE)架构上评估了TaT,测试范围涵盖常识推理、问答和有毒性检测。无需访问激活本身,仅使用跨层级激活变化,我们展示了TaT有效缓解了静态词汇干扰的依赖,超越传统探针方法,在解释性方面建立了轨迹分析作为互补视角的地位。

关键词

引用

@article{arxiv.2603.01326,
  title  = {Truth as a Trajectory: What Internal Representations Reveal About Large Language Model Reasoning},
  author = {Hamed Damirchi and Ignacio Meza De la Jara and Ehsan Abbasnejad and Afshar Shamsi and Zhen Zhang and Javen Shi},
  journal= {arXiv preprint arXiv:2603.01326},
  year   = {2026}
}