探测大语言模型中推理轨迹的路径
机器学习
2026-02-02 v1 人工智能
摘要
大型语言模型(LLMs)在生成最终响应之前,越来越多地通过产生“推理轨迹”来解决难题。然而,准确性和决策承诺如何沿着推理轨迹演变,以及中间轨迹片段是否提供了超出通用长度或风格效应的答案相关信息,目前仍不清楚。在此,我们提出了一种系统性地探测LLMs中推理轨迹路径的方案,具体步骤为:1)生成模型的推理轨迹,2)在固定的token百分位数处截断它,以及3)将每个部分轨迹重新注入模型(或另一个模型),通过下一个token的概率来测量在答案选项上的诱导分布。我们将此方案应用于开源模型Qwen3-4B/-8B/-14B和gpt-oss-20b/-120b,并在多项选择基准GPQA Diamond和MMLU-Pro上进行测试。我们发现,随着提供的推理token百分比的增加,准确性和决策承诺持续提高。这些提升主要由模型生成中的相关内容驱动,而非上下文长度或通用的“推理风格”效应。更强的模型通常能从错误的部分轨迹中成功回溯,但即时答案往往仍锚定在较弱模型的错误响应上。更广泛地说,我们表明,轨迹探测为推理模型的高效和安全部署提供了诊断工具,因为其测量结果可以为实际的轨迹处理与监控策略提供信息,从而在无需假设中间token是固有忠实解释的情况下提高可靠性。
引用
@article{arxiv.2601.23163,
title = {Probing the Trajectories of Reasoning Traces in Large Language Models},
author = {Marthe Ballon and Brecht Verbeken and Vincent Ginis and Andres Algaba},
journal= {arXiv preprint arXiv:2601.23163},
year = {2026}
}
备注
33 pages, 20 figures, 4 tables