PathCal:基于状态感知的反思标记校准以提高推理效率
人工智能
2026-05-25 v1
摘要
大型推理语言模型(LRM)的出现,使得通过在推理期间生成长格式的链式思考(CoT)轨迹来应对复杂推理任务成为可能。同时,这些轨迹常包含明确的反思标记,如“wait”、“but”和“alternatively”,分别表示犹豫、修订和考虑替代探索。最近的测试时控制研究利用这些标记作为引导推理的轻量级句柄,通常将其视为单一粗粒度类别,而不区分其 distinct 功能角色。本文我们进行类型级抑制和固定前缀干预,揭示反思标记不仅在功能角色上不同,还在何时发挥最大影响。具体而言,不同标记类别以不同方式影响准确率和生成长度,标记选择在模型稳定推理轨迹前最为重要。基于这些发现,我们引入PathCal,一种新颖的训练-free解码控制器,通过区分标记类型并仅在局部不确定状态下进行干预来校准推理路径。在每个解码步骤处,PathCal利用反思标记分布来估计维持当前推理轨迹与发起竞争性分支之间的局部竞争,当竞争性证据过度时进行软性重新平衡。六个推理基准测试表明,PathCal在更好的效率-性能权衡下实现了准确率保持或提升、生成长度缩短,无需依赖外部验证器或额外抽样。
引用
@article{arxiv.2605.23074,
title = {PathCal: State-Aware Reflection-Marker Calibration for Efficient Reasoning},
author = {Lingyu Jiang and Zirui Li and Shuo Xing and Peiran Li and Tsubasa Takahashi and Dengzhe Hou and Zhengzhong Tu and Kazunori Yamada and Fangzhou Lin},
journal= {arXiv preprint arXiv:2605.23074},
year = {2026}
}
备注
21 pages, 5 figures, 7 tables