中文

Gold-Switch:无训练的慢-快速思维 LLM 叠加

计算与语言 2025-10-09 v1

摘要

大型推理模型(LRM)在结构化任务中通过模拟人类的深思熟虑而卓越,但常因过度思考而损害性能并浪费资源。一种可能的基线是同时部署 LLM 和 LRM,然后通过预测是否需要推理来路由输入,但这会导致成本高昂或不切实际。我们提出一种叠加部署策略,配合轻量级、无训练的调节以优化推理,通过切换一个模型的开关来实现计算资源的最优配置。我们不进行路由,而是对 LRM 在推理时进行选择性“遗忘”,在保持推理能力的同时缩减计算。通过分析奇异值累积能,我们识别出最佳的低秩投影,用于恰到好处地调整推理。

关键词

引用

@article{arxiv.2510.06750,
  title  = {Gold-Switch: Training-Free Superposition of Slow- and Fast- Thinking LLMs},
  author = {Jaeseong Lee and Dayoung Kwon and seung-won hwang},
  journal= {arXiv preprint arXiv:2510.06750},
  year   = {2025}
}