R-Stitch:用于高效推理的动态轨迹拼接
机器学习
2026-02-10 v6 人工智能
计算与语言
摘要
链式思维(CoT)通过增强大型语言模型(LLM)的问题解决能力,但由于长的自回归轨迹,推理成本较高。现有的加速策略要么通过提前停止或压缩轨迹来缩短轨迹,要么采用较小模型的预测解码。然而,当模型一致性较低时,预测解码的提升有限,并且严格强制执行基于标记的一致性,忽略了一些较小模型在正确时会产生显著更简洁推理轨迹以减少推理长度的观察。我们引入R-Stitch,这是一种无训练的混合解码框架,利用基于标记熵的不确定性代理在小型语言模型(SLM)和LLM之间进行计算分配。我们的分析表明,高熵标记更可能导致错误,激励基于熵的路由策略,使SLM高效处理低熵标记,而将不确定的标记委托给LLM,从而避免完整回滚并保持答案质量。我们进一步通过R-Stitch扩展了该设计,其学习自适应路由策略以超出固定阈值的动态调整标记预算。通过同时减少每个标记的解码复杂度和生成的标记数量,我们的方法在保持与完整LLM解码相当的准确性方面实现了显著的加速。具体而言,它在DeepSeek-R1-Distill-Qwen-7B上实现了最高3.00倍的加速,在14B模型上实现了3.85倍,在QWQ-32B上实现了4.10倍。此外,它自然地实现了可适应的效率-准确性权衡,可根据不同计算预算进行调整,而无需重新训练。
引用
@article{arxiv.2507.17307,
title = {R-Stitch: Dynamic Trajectory Stitching for Efficient Reasoning},
author = {Zhuokun Chen and Zeren Chen and Jiahao He and Lu Sheng and Mingkui Tan and Jianfei Cai and Bohan Zhuang},
journal= {arXiv preprint arXiv:2507.17307},
year = {2026}
}