GlimpRouter:通过瞥见思维的一个Token实现高效协作推理
人工智能
2026-04-29 v3
摘要
大型推理模型(LRM)通过显式生成多步思维链实现了卓越的性能,但这种能力带来了显著的推理延迟和计算成本。协作推理通过在轻量级和大型模型之间有选择地分配工作提供了一种有前途的解决方案,但一个根本挑战仍然存在:确定何时一个推理步骤需要大型模型的容量或小型模型的效率。现有的路由策略要么依赖局部Token概率,要么依赖事后验证,引入了显著的推理开销。在这项工作中,我们提出了一种关于逐步协作的新视角:推理步骤的难度可以从其第一个Token推断出来。受LRM中“顿悟时刻”现象的启发,我们表明初始Token的熵可以作为步骤难度的强预测器。基于这一见解,我们引入了GlimpRouter,一个免训练的逐步协作框架。GlimpRouter采用轻量级模型仅生成每个推理步骤的第一个Token,并仅在初始Token熵超过阈值时将该步骤路由到更大的模型。在多个基准测试上的实验表明,我们的方法在保持准确性的同时显著降低了推理延迟。例如,与独立大型模型相比,GlimpRouter在AIME25上实现了10.7%的准确率提升,同时将推理延迟降低了25.9%。这些结果表明了一种简单而有效的推理机制:基于对思维的一瞥而非全步评估来分配计算。
引用
@article{arxiv.2601.05110,
title = {GlimpRouter: Efficient Collaborative Inference by Glimpsing One Token of Thoughts},
author = {Wenhao Zeng and Xuteng Zhang and Yuling Shi and Chao Hu and Yuting Chen and Beijun Shen and Xiaodong Gu},
journal= {arXiv preprint arXiv:2601.05110},
year = {2026}
}
备注
Accepted to ACL 2026 Findings. Code available at https://github.com/Zengwh02/GlimpRouter