真理即轨迹:揭示大语言模型推理的内部表征
计算与语言
2026-03-03 v1 机器学习
摘要
现有的大语言模型(LLM)解释方法通常将隐藏状态视为激活空间中的静态点,假设正确推理与错误推理可通过单层表示进行分离。然而,这些激活被多义特征饱和,导致线性探针学习表层词汇模式,而非底层推理结构。我们提出“真理即轨迹”(Truth as a Trajectory,TaT),将Transformer推理建模为迭代细化的展开轨迹,分析从静态激活转向层级几何位移。通过分析跨层级表示的位移,TaT揭示了区分有效推理与虚构行为的几何不变量。我们在密集架构和混合专家(Mixture-of-Experts,MoE)架构上评估了TaT,测试范围涵盖常识推理、问答和有毒性检测。无需访问激活本身,仅使用跨层级激活变化,我们展示了TaT有效缓解了静态词汇干扰的依赖,超越传统探针方法,在解释性方面建立了轨迹分析作为互补视角的地位。
引用
@article{arxiv.2603.01326,
title = {Truth as a Trajectory: What Internal Representations Reveal About Large Language Model Reasoning},
author = {Hamed Damirchi and Ignacio Meza De la Jara and Ehsan Abbasnejad and Afshar Shamsi and Zhen Zhang and Javen Shi},
journal= {arXiv preprint arXiv:2603.01326},
year = {2026}
}