MentorCollab:高效推理的大模型到小模型选择性推理引导
计算与语言
2026-02-06 v1
摘要
大型推理模型(LRM)通过生成长链思维实现卓越性能,但其推理成本高且常产生冗余推理。小型语言模型(SLM)更高效,但在多步骤推理任务中表现不足。让大模型在推理时作为导师指导小模型是自然的想法,但现有合作方法常促进模仿,导致推理冗长且错误更难纠正。我们提出 MentorCollab,一种在大模型和小模型推理时的合作方法,大模型 selectively and sparsely 指导小模型,而非接替其生成。在随机抽样的 token 位置,我们探测两种模型之间的差异,并使用轻量级验证器决定小模型应跟随其导师的短视线索片段,还是继续独立推理。我们测试了 15 种 SLM-LRM 组合和 3 个领域(数学推理、常识推理和常识推理),该方法在 12 种情形下提升性能,平均提升 3.0%,最高可达 8.0%,而仅使用 18.4% 的 token 由高成本导师模型生成。我们发现,短片段和选择性探测足以实现有效的合作。我们的研究表明,选择性推理引导可在不显著增加推理开销的前提下恢复大模型的推理能力。
引用
@article{arxiv.2602.05307,
title = {MentorCollab: Selective Large-to-Small Inference-Time Guidance for Efficient Reasoning},
author = {Haojin Wang and Yike Wang and Shangbin Feng and Hannaneh Hajishirzi and Yulia Tsvetkov},
journal= {arXiv preprint arXiv:2602.05307},
year = {2026}
}