中文

通向推理之路:用于 LLM 与推理策略选择的自适应路由

计算与语言 2025-05-27 v1

摘要

语言模型(LM)的固有能力及其所采用的推理策略共同决定了其在推理任务中的表现。虽然测试时扩展被认为是解决复杂推理任务的有效方法,但它会产生大量的计算成本,并经常导致“过度思考”,即模型陷入“思维陷阱”。为了应对这一挑战,我们提出了 Route-To-Reason (RTR),一个新颖的统一路由框架,可在预算约束下根据任务难度动态分配 LM 和推理策略。RTR 学习专家模型和推理策略的压缩表示,从而在推理时实现它们的联合自适应选择。该方法成本低、灵活性高,并且可以无缝扩展到任意的黑盒或白盒模型及策略,实现真正的即插即用功能。在七个开源模型和四种推理策略上的大量实验表明,RTR 在所有基线中实现了准确率和计算效率之间的最佳权衡,在将 token 使用量减少 60% 以上的同时,取得了比最佳单一模型更高的准确率。

关键词

引用

@article{arxiv.2505.19435,
  title  = {Route to Reason: Adaptive Routing for LLM and Reasoning Strategy Selection},
  author = {Zhihong Pan and Kai Zhang and Yuze Zhao and Yupeng Han},
  journal= {arXiv preprint arXiv:2505.19435},
  year   = {2025}
}