方向推理轨迹变更(DRTC):识别推理模型中的关键轨迹片段
机器学习
2026-03-03 v2
摘要
理解语言模型如何执行长程推理仍是开放挑战。现有可解释性方法常在答案相关联的标记上提供高亮,却很少揭示何处出现决定性推理转折、在因果干预下何种早期上下文触发它们,或突出显示的文本是否实际引导rollout。我们提出Directional Reasoning Trajectory Change(DRTC),一种基于过程-因果的方法,(i) 通过不确定性和分布偏移信号检测枢轴决策点,(ii) 应用接收端干预,在仅在枢轴处阻断来自所选早期块的特定信息流的同时保持实现的延续。DRTC 测量每块干预相对于实现的rollout方向的log概率轨迹的重定向,生成每块的符号归因;我们还计算logit空间曲率变化及其曲率特征作为互补几何诊断。跨四个推理模型,影响力高度集中(Gini约0.50-0.58,前5%质量约0.23-0.28),学习到的枢轴效应显著高于匹配的随机片段。在规模为500题的MATH测试中以R1-Distill-Qwen-1.5B为例,学习得到的片段持续优于匹配的随机片段(中性Delta=0.409,355/500为正;p=2.3e-21),且曲率影响在DRTC内与之共定位作为诊断。我们对比了基于梯度和扰动的块归因方法,展示了分级结果关联:在嵌入插值编辑下,顶级DRTC块比严格位置匹配的随机块在经稳定性筛选子集上降低更高的teacher-forced gold-answer log概率。总体而言,DRTC提供了一种以因果为基础的视角,揭示特定上下文元素如何引导策略推理轨迹。
引用
@article{arxiv.2602.15332,
title = {Directional Reasoning Trajectory Change (DRTC): Identifying Critical Trace Segments in Reasoning Models},
author = {Waldemar Chang},
journal= {arXiv preprint arXiv:2602.15332},
year = {2026}
}