Gold-Switch:无训练的慢-快速思维 LLM 叠加
计算与语言
2025-10-09 v1
摘要
大型推理模型(LRM)在结构化任务中通过模拟人类的深思熟虑而卓越,但常因过度思考而损害性能并浪费资源。一种可能的基线是同时部署 LLM 和 LRM,然后通过预测是否需要推理来路由输入,但这会导致成本高昂或不切实际。我们提出一种叠加部署策略,配合轻量级、无训练的调节以优化推理,通过切换一个模型的开关来实现计算资源的最优配置。我们不进行路由,而是对 LRM 在推理时进行选择性“遗忘”,在保持推理能力的同时缩减计算。通过分析奇异值累积能,我们识别出最佳的低秩投影,用于恰到好处地调整推理。
引用
@article{arxiv.2510.06750,
title = {Gold-Switch: Training-Free Superposition of Slow- and Fast- Thinking LLMs},
author = {Jaeseong Lee and Dayoung Kwon and seung-won hwang},
journal= {arXiv preprint arXiv:2510.06750},
year = {2025}
}