RelayGen:高效推理的生成内模型切换
计算与语言
2026-02-09 v1
摘要
大规模推理模型(LRMs)通过生成长篇、多步骤推理轨迹在复杂推理任务上实现强大的性能,但推理时间的扩展导致重大的部署成本。一个关键挑战是生成难度在单个输出的不同位置变化,而现有效率导向方法要么忽略这种生成内变化,要么依赖高系统复杂度的监督式token级路由。我们提出了RelayGen,一种无训练的、基于段落级别的运行时模型切换框架,利用长程推理中的难度变化。通过对生成不确定性进行离线分析(如基于token概率边际),我们展示了粗粒度的段落级别控制足以捕获推理轨迹中的难度转换。RelayGen识别模型特定的切换线索,这些线索信号着�切换到较低难度段落的能力,同时在大模型上保留高难度推理。在多个推理基准测试中,RelayGen显著减少了推理延迟,同时保留了大模型的大部分准确率。当与推测解码结合使用时,RelayGen可实现最高2.2倍的端到端加速,仅有不到2%的准确率下降,且无需额外训练或学习型路由组件。
引用
@article{arxiv.2602.06454,
title = {RelayGen: Intra-Generation Model Switching for Efficient Reasoning},
author = {Jiwon Song and Yoongon Kim and Jae-Joon Kim},
journal= {arXiv preprint arXiv:2602.06454},
year = {2026}
}